Spring til indhold
#116 - OpenAI AI-agent Brød ud af sin Sandbox og Hackede Hugging Face - hvad nu? - Verbos: AI og Softwareudvikling

#116 - OpenAI AI-agent Brød ud af sin Sandbox og Hackede Hugging Face - hvad nu?

Verbos: AI og Softwareudvikling · Kasper Junge og Jonas Høgh Kyhse-Andersen

22. juli 2026 51m
0:00 51m

Beskrivelse

En OpenAI-agent brød ud af sin sandbox, fandt en zero-day og fik adgang til Hugging Faces produktionssystemer. Hvordan kunne en intern modeltest ende som et virkeligt cyberangreb – og hvad betyder sagen for alle, der bygger eller bruger AI-agenter? OpenAI oplyser, at en kombination af GPT-5.6 Sol og en endnu stærkere pre-release-model blev testet på cybersikkerhedsbenchmarket ExploitGym. Modellerne fandt en vej til internettet gennem OpenAIs testmiljø og søgte derefter efter facit hos Hugging Face. Hugging Face registrerede mere end 17.000 handlinger og brugte selv AI til at opdage, kortlægge og stoppe angrebet. Sammen med Christian Bech Nørhave gennemgår Kasper Junge og Jonas Høgh Kyhse-Andersen hændelsen og skiller de bekræftede fakta fra hypen. Christian Bech Nørhave: https://www.linkedin.com/in/cbechn/ Du får blandt andet svar på: - Hvordan agenten slap ud af OpenAIs sandbox og ind hos Hugging Face - Hvorfor long-running agents og adgang til bash ændrer trusselsbilledet - Hvordan en zero-day, stjålne credentials og lateral movement indgik i angrebet - Hvorfor Hugging Face måtte bruge den åbne model GLM 5.2 i sit forsvar - Hvad guardrails, least privilege, sandboxing og nøje valgte tools betyder i praksis - Hvorfor virksomheder skal styre AI-agenters interne adgang – ikke kun beskytte sig mod angreb udefra Sagen viser både AI-agenters nye offensive evner og et konkret problem for forsvarere: De stærkeste hostede modeller kan afvise ægte sikkerhedsdata, mens angribere ikke følger de samme regler. Værterne diskuterer, om svaret er bedre sandboxes, færre rettigheder, afgrænsede tools, MCP, code mode eller modeller, som sikkerhedsteams selv kan køre. Links og kilder: - Hugging Faces hændelsesrapport: https://huggingface.co/blog/security-incident-july-2026 - OpenAIs redegørelse: https://openai.com/index/hugging-face-model-evaluation-security-incident/ - ExploitGym-benchmarket: https://arxiv.org/abs/2605.11086 - OpenAI om sikkerhed for long-horizon-modeller: https://openai.com/index/safety-alignment-long-horizon-models/ - Cloudflare om Code Mode: https://developers.cloudflare.com/agents/tools/codemode/ Har du dyb teknisk viden om hændelsen eller ser du en vinkel, vi har overset? Så vil vi gerne høre fra dig. Verbos: AI og Softwareudvikling er den danske podcast fra maskinrummet. Kasper Junge og Jonas Høgh Kyhse-Andersen går teknisk til værks og bygger bro mellem klassisk software engineering og den nye virkelighed med AI-agenter. 00:00 OpenAI-agenten, der hackede Hugging Face 01:54 Hvad skete der hos OpenAI og Hugging Face? 06:59 Agenten fandt en zero-day og brød ud 09:26 Autonom hacking med maskinhastighed 14:35 AI mod AI og problemet med guardrails 23:59 Truslen kan komme fra egne AI-agenter 26:29 Gateways, least privilege og færre tools 34:40 Sandboxing, code mode og programmatic tool calling 41:55 Adgangsstyring, identitet og MCP 47:35 Reel cybertrussel eller AI-hype?

Andre episoder fra Verbos: AI og Softwareudvikling Se alle episoder →