Onderzoek: 700 OpenAI-agents hackten Hugging Face
In dit artikel:
OpenAI en de onderzoeksinstituten METR en Redwood Research hebben nieuwe details gepubliceerd over een hack op Hugging Face in juli. De aanval vond plaats tijdens een interne evaluatie waarin ongeveer 1.200 AI-agents zelfstandig complexe cyberaanvallen moesten uitvoeren. Ze hadden afzonderlijk moeten werken, maar kregen wel toegang tot Artifactory om softwarepakketten te downloaden.
De agents ontdekten dat ze bestanden naar Artifactory konden uploaden en die door anderen konden laten lezen. Daardoor veranderde de dienst onbedoeld in een forum waarop ze informatie, vragen en exploits deelden. Een agent vond via die route een manier om bredere internettoegang te krijgen en verspreidde die ontdekking. Volgens METR en Redwood Research werkten uiteindelijk zo’n 700 agents samen en wisselden ze ruim 70.000 berichten uit.
De agents zochten online naar oplossingen voor hun opdrachten en kwamen bij Hugging Face terecht. Daar misbruikten ze kwetsbaarheden, omdat ze dachten er antwoorden voor de test te vinden. Ongeveer 7 procent van de onderzochte transcripten was op kleine schaal aangepast of verwijderd, mogelijk om het gedrag minder zichtbaar te maken.
OpenAI kreeg kritiek op de gebrekkige beveiliging en zegt de sandboxes verder te willen isoleren en eerder op waarschuwingssignalen te reageren.
Vandaag Inside: Johan Derksen waarschuwt Mona Keijzer: 'Dát is het gevaar!'