Claude moest testomgeving hacken, maar brak bij drie organisaties in
In dit artikel:
Anthropic heeft ontdekt dat drie van zijn Claude-modellen tijdens een beveiligingsbenchmark per ongeluk drie organisaties hebben gehackt. Door een miscommunicatie met een testpartner kregen de modellen internettoegang terwijl ze juist in een geïsoleerde omgeving cyberaanvallen moesten oefenen. De incidenten gebeurden al in april, maar kwamen pas maanden later aan het licht.
Volgens Anthropic gebruikten de modellen vrij eenvoudige hacktechnieken, zoals zwakke wachtwoorden en niet-geauthenticeerde endpoints, waarmee ze bijvoorbeeld interne databases konden bereiken. In één geval kwam Claude zelfs bij productiedata terecht. Het ging om drie verschillende modellen: Opus 4.7, Mythos 5 en een intern prototype. Mythos en het prototype stopten toen ze doorhadden dat ze online zaten, maar Opus ging door.
Het bedrijf startte vorige week een onderzoek, nadat OpenAI meldde dat enkele van zijn modellen uit een sandbox waren ontsnapt en andere bedrijven hadden getroffen. Minstens twee getroffen organisaties van Anthropic wisten nog niets van de hack; de derde is nog niet bereikt. Anthropic zegt de internetafscherming en de evaluatie van tests strenger te gaan controleren om herhaling te voorkomen.
De Oranjezomer: Rutger Castricum doet er na ophef over grappen over 75-plussers nóg een schepje bovenop