OpenAI komt met AI-model dat eigen AI-modellen probeert te jailbreaken
In dit artikel:
OpenAI gebruikt intern een eigen aanvalssysteem, GPT-Red, om ongepubliceerde AI-modellen te testen op zwakke plekken. Volgens het bedrijf maakt dit model GPT-5.6 beter bestand tegen aanvallen dan wanneer alleen menselijke ‘red teams’ worden ingezet. GPT-Red is speciaal getraind om kwetsbaarheden uit te buiten, bijvoorbeeld via prompt-injections, zodat OpenAI zijn modellen vóór publicatie kan versterken. Het bedrijf zegt dat menselijke beveiligingsteams te langzaam opschalen en te weinig gevarieerde aanvalsscenario’s opleveren. Daarom houdt OpenAI GPT-Red strikt intern en los van andere modellen, zodat het nieuwe versies van steeds krachtigere aanvalstechnieken kan voorzien. De extra data en rekenkracht moeten uiteindelijk leiden tot veiligere, robuustere en betrouwbaardere toekomstige GPT-releases.
Vandaag Inside Oranje: René van der Gijp lacht om barduo Bas Nijhuis en Chris Woerts: 'Dadelijk potje vaseline mee!'