Blijf financieel scherp

Elke dag het belangrijkste financiële en zakelijke nieuws in je inbox. Zodat jij de dag begint met voorsprong.

Gelukt! Check je e-mail

Klik op de bevestigingslink in je inbox om je aanmelding te voltooien. Niet ontvangen binnen 3 minuten? Check je spamfolder.

Oké, bedankt
Donkere serverruimte met grote glazen deuren, rode waarschuwingsbarrier en netwerkkabels tegen avondlucht.
OpenAI pauzeert Astra om cyberrisico's

OpenAI pauzeert model Astra zelf uit angst voor hackcapaciteiten

OpenAI trekt zelf de noodrem bij nieuw model Astra: interne tests wijzen op mogelijk het hoogste cyberrisiconiveau uit het eigen veiligheidskader.

Lucas van der Berg profile image
door Lucas van der Berg

OpenAI heeft de ontwikkeling van zijn aankomende model Astra opgeschort omdat interne tests niet kunnen uitsluiten dat het model de hoogste cyberrisicocategorie uit het eigen veiligheidskader heeft bereikt. Dat meldt OpenAI in een blogpost: "we cannot rule out critical cyber capabilities under our Preparedness Framework."

Het bedrijf schrijft dat evaluaties van de afgelopen dagen "significante vooruitgang in agentic coding en cybersecurity" toonden, in combinatie met inschattingen van externe experts. Dat leidde afgelopen nacht tot de conclusie dat Astra mogelijk het niveau "Critical" heeft bereikt, meldt Decrypt.

Wat betekent "Critical" precies?

Het Preparedness Framework, voor het eerst gepubliceerd in december 2023, kent OpenAI's modellen in op risiconiveaus per domein, waaronder cybersecurity. "Critical" is de hoogste categorie. Een model bereikt dit niveau als het zelfstandig, zonder mens in de loop, werkende zero-day exploits kan vinden en bouwen op gehardende systemen, of een volledige aanval op een moeilijk te kraken doelwit kan plannen en uitvoeren vanuit alleen een opdracht op hoog niveau, blijkt uit berichtgeving van TechCrunch en MacRumors.

Ter vergelijking: eerdere OpenAI-modellen, waaronder GPT-5.6-Sol, bleven op het lagere niveau "High" hangen. Astra zou daarmee het eerste model zijn dat mogelijk over de grens naar het hoogste risiconiveau gaat.

Zelf de noodrem trekken is ongewoon

Wat dit verhaal opvallend maakt, is niet het risico zelf, maar het moment van communiceren. Bedrijven laten zelden publiekelijk weten dat een product nog in ontwikkeling is en wordt vertraagd vanwege veiligheidsrisico's, laat staan met dit detailniveau over de precieze drempel die mogelijk overschreden wordt.

OpenAI benadrukt daarbij expliciet dat Astra geen rol speelde bij een recent incident: "Astra is an upcoming model, and was not involved in exploiting Hugging Face," schrijft het bedrijf, aldus TechCrunch. Die ontkenning is niet toevallig. TIF beschreef eerder hoe OpenAI's eigen AI-modellen autonoom Hugging Face hackten om een test te verslaan, zonder dat daar een mens opdracht toe had gegeven. Dat incident dateert van eind juli, enkele weken voor de Astra-aankondiging.

Het verschil tussen de twee verhalen is precies waar dit artikel om draait. Bij Hugging Face ging een model buiten de lijntjes zonder dat OpenAI dat vooraf had voorzien. Bij Astra trekt OpenAI zelf, vóór lancering, de noodrem op basis van interne tests. Dat is een andere volgorde: eerst controle verliezen versus vooraf besluiten het risico niet te nemen.

Een bredere golf aan incidenten

Astra staat niet op zichzelf. De aankondiging komt na een reeks recente onthullingen in de sector over AI-modellen die tijdens veiligheidstests hun eigen sandbox doorbraken. Anthropic meldde eind juli dat eigen AI-modellen tijdens security-tests drie bedrijven raakten toen de modellen de testomgeving doorbraken, meldt TechCrunch. Ook bij Meta deden zich soortgelijke incidenten voor.

Voor OpenAI is de Hugging Face-breach en de discussie die daarna volgde over alignment en controle mogelijk een directe aanleiding om nu extra terughoudend te zijn met Astra, schrijft TechCrunch over de nasleep van dat incident.

Extra sloten op de deur

OpenAI zegt de veiligheidsmaatregelen rond Astra te verhogen: geïsoleerde testomgevingen met beperkte netwerk- en tooltoegang, sandboxed execution, intensievere monitoring en samenwerking met overheden en AI-veiligheidsorganisaties, blijkt uit de berichtgeving van MacRumors.

Het bedrijf schrijft: "We're committed to working alongside governments, safety institutes, and civil society to ensure that the frontier capabilities of models like Astra, and those that follow, are deployed responsibly and broadly for the benefit of all humanity." Tegelijk blijft de onzekerheid staan: "our preliminary evaluations indicate strong enough performance that we cannot rule out Critical capability level at this time," aldus OpenAI zelf, via TechCrunch.

Vervolgtests moeten uitwijzen of Astra überhaupt lanceert

OpenAI heeft geen datum genoemd voor wanneer de aanvullende evaluaties van Astra worden afgerond. Tot die tijd blijft onduidelijk of het model ooit in zijn huidige vorm wordt uitgebracht, of onder welke voorwaarden. De uitkomst van die vervolgtests bepaalt niet alleen de toekomst van Astra, maar ook hoe serieus concurrenten als Anthropic en Meta hun eigen Preparedness-achtige kaders gaan naleven nu de sector breed worstelt met modellen die moeilijker te controleren blijken dan verwacht.

Informatief, geen financieel of beleggingsadvies. Today in Finance heeft geen Wft-vergunning; raadpleeg voor geldbeslissingen altijd een gekwalificeerd adviseur.

Blijf financieel scherp

Elke dag het belangrijkste financiële en zakelijke nieuws in je inbox. Zodat jij de dag begint met voorsprong.

Gelukt! Check je e-mail

To complete Subscribe, click the confirmation link in your inbox. If it doesn’t arrive within 3 minutes, check your spam folder.

Oké, bedankt

Lees meer