Een onderzoeker die de afgelopen drie jaar aan modellen van OpenAI en Anthropic werkte, trekt de stekker eruit. Jacob Coxon zegt dat beide AI-bedrijven te hard richting zelfverbeterende systemen racen terwijl niemand overtuigend kan aantonen dat zulke toekomstige systemen onder controle blijven.
Zijn vertrek legt een conflict bloot dat normaal achter laboratoriumdeuren blijft. Anthropic waarschuwt zelf voor toekomstige AI-risico's, maar blijft tegelijk krachtigere modellen bouwen.
Coxon maakte zijn ontslag bekend in een reeks berichten op X. Hij zegt drie jaar pretrainingonderzoek te hebben gedaan bij OpenAI en Anthropic.
“They are racing straight to self-improving superintelligence and gambling with our lives.”
Dat is zijn oordeel. Het is geen bewijs dat huidige AI-systemen een existentieel gevaar vormen.
Coxon vreest AI die steeds meer AI bouwt
Het zwaarste scenario draait om recursieve zelfverbetering.
Daarbij neemt AI steeds meer werk over dat nodig is om een volgende generatie AI te bouwen. Denk aan code schrijven, experimenten ontwerpen, onderzoeksresultaten analyseren en trainingsmethoden verbeteren.
Een krachtiger model helpt vervolgens bij zijn eigen opvolger. Die opvolger kan hetzelfde proces mogelijk nog sneller uitvoeren.
Anthropic onderzoekt dat scenario zelf.
In When AI builds itself schrijft het bedrijf dat AI nu al een groeiend deel van zijn eigen ontwikkelproces ondersteunt. Anthropic-engineers leveren volgens die analyse gemiddeld acht keer zoveel code per kwartaal als in de periode 2021 tot en met 2025.
Anthropic zegt daarbij expliciet dat volledige recursieve zelfverbetering nog niet bestaat en niet onvermijdelijk is.
Wel denkt het bedrijf dat die mogelijkheid sneller kan naderen dan veel organisaties verwachten.
Precies daar zit Coxons bezwaar: wachten op zekerheid kan te laat zijn wanneer de technologie zelf de ontwikkelsnelheid gaat verhogen.
Anthropic-veiligheidsleider noemt kans boven 10%
Coxons vertrek kreeg extra gewicht door Evan Hubinger.
Hubinger werkt binnen Anthropics Alignment Science en reageerde publiekelijk op de waarschuwing. Hij schatte persoonlijk de kans dat AI binnen tien jaar een catastrofe veroorzaakt waarbij alle mensen sterven op meer dan 10%.
Dat percentage is geen officiële risicoschatting van Anthropic.
Het is Hubingers persoonlijke inschatting.
Hij schreef daarnaast dat Anthropic volgens hem serieus probeert het probleem aan te pakken, maar nog geen opgelost plan heeft voor het veilig afstemmen van toekomstige superintelligentie. Hubingers reactie staat hier.
Dat onderscheid telt. Een senior onderzoeker die 10% noemt, betekent niet dat Anthropic als bedrijf dezelfde kans hanteert.
Huidige AI-modellen vallen niet onder die waarschuwing
Hubinger maakte later zelf een belangrijke nuance.
Zijn zorgen gaan volgens hem niet over de huidige generatie modellen. Hij richt zich op veel krachtigere systemen die mogelijk ontstaan wanneer AI zijn eigen ontwikkeling vergaand kan versnellen. Hij verduidelijkte dat in een tweede bericht.
Dat sluit aan bij Anthropics eigen beoordelingen.
In de documentatie rond Claude Mythos Preview concludeerde het bedrijf dat de totale catastrofale risico's van dat model laag bleven, ondanks duidelijke vooruitgang in onder meer cybersecurity.
Dat maakt de discussie minder spectaculair, maar ook interessanter.
De waarschuwing is niet: Claude neemt morgen de wereld over.
De vraag is wat er gebeurt wanneer toekomstige modellen veel autonomer worden en tegelijk een groot deel van het volgende AI-onderzoek uitvoeren.
Anthropic bouwt door én scherpt veiligheidsregels aan
Coxon en Anthropic verschillen daardoor niet simpelweg over de vraag óf AI risico's kan veroorzaken.
Anthropic erkent die risico's zelf nadrukkelijk.
Het bedrijf werkt met een Responsible Scaling Policy die zwaardere maatregelen koppelt aan sterkere modelcapaciteiten. De nieuwste versie scherpt onder meer de drempel aan voor geautomatiseerd AI-onderzoek. De actuele Responsible Scaling Policy.
Anthropic publiceert daarnaast Risk Reports en test modellen op misalignment, cyberaanvallen, biologische toepassingen en autonomie.
Het bedrijf stelt zelfs dat overheden sterkere regels moeten kunnen opleggen wanneer modellen aantoonbaar grote risico's creëren.
Coxons kritiek gaat verder.
Hij vindt het onvoldoende om veiligheidsmaatregelen tegelijk met de modellen te verbeteren wanneer bedrijven onderling blijven racen om steeds sterkere systemen te bouwen.
Daar ligt het echte meningsverschil.
De AI-race maakt wachten moeilijk
Frontierlabs zitten met een klassiek probleem.
Een bedrijf kan besluiten voorzichtiger te ontwikkelen. Maar als een concurrent doorgaat, kan die partij sneller sterkere modellen bereiken.
Dat creëert druk om zelf ook door te bouwen.
Coxon verzet zich tegen het argument dat individuele onderzoekers daarom maar moeten accepteren dat de race toch doorgaat.
Zijn vertrek is daarmee geen technisch bewijs tegen Anthropic of OpenAI. Het is een politieke keuze van iemand die niet langer aan die wedstrijd wil deelnemen.
Anthropic kiest voorlopig voor een ander model: doorgaan met ontwikkeling, maar tegelijk met strengere evaluaties, toegangsbeperkingen en beveiliging.
Zo werd Claude Mythos Preview vanwege zijn cybercapaciteiten niet meteen breed beschikbaar gemaakt. Anthropic koos eerst voor beperkte toegang bij geselecteerde organisaties.
AI schrijft nu al mee aan zijn eigen ontwikkeling
Het debat krijgt gewicht doordat de eerste stap richting geautomatiseerd onderzoek al zichtbaar is.
Anthropic zegt zelf dat zijn AI-systemen steeds meer programmeer- en onderzoekstaken uitvoeren.
Dat is nog iets anders dan een AI die autonoom besluit een slimmere versie van zichzelf te bouwen.
Mensen bepalen nog doelen, trainingsruns en toegang tot rekenkracht.
Maar als steeds meer tussenstappen worden geautomatiseerd, kan de snelheid waarmee nieuwe modellen verschijnen toenemen. Dat verkort ook de tijd waarin onderzoekers, bedrijven en toezichthouders nieuwe eigenschappen kunnen beoordelen.
Die tijdsdruk zit onder Coxons waarschuwing.
Europa kan sinds augustus harder optreden tegen zware modellen
Ook Europa heeft dit vraagstuk expliciet in regels verwerkt.
Sinds 2 augustus 2026 zijn de bepalingen van de AI Act voor aanbieders van general-purpose AI-modellen handhaafbaar. Voor modellen met systeemrisico gelden extra verplichtingen rond evaluaties, risicobeperking, incidentmeldingen en cybersecurity. De Europese Commissie legt de handhaving hier uit.
Dat betekent niet dat de volledige AI Act sinds die datum integraal geldt.
Andere onderdelen krijgen later pas werking. De regels voor general-purpose AI zijn sinds 2 augustus wel een stuk harder afdwingbaar.
Voor Anthropic, OpenAI en andere aanbieders die Europese gebruikers bedienen, wordt het debat over toekomstige modelrisico's daardoor ook een toezichtsvraag.
AI-agents maken het probleem concreter voor crypto
Voor crypto wordt de discussie minder abstract zodra AI-agents daadwerkelijk financiële bevoegdheden krijgen.
Een agent kan toegang krijgen tot wallets, handelssoftware of betaalrekeningen. Vervolgens kan software zelfstandig transacties voorbereiden of uitvoeren.
Met stablecoins kan zo'n agent bovendien vrijwel continu digitaal geld verplaatsen.
En via smart contracts kunnen vooraf regels worden vastgelegd over wat software wel en niet mag uitvoeren.
Dan wordt alignment plots een financieel probleem.
Hoeveel mag de agent uitgeven? Welke adressen zijn toegestaan? Wie kan toestemming intrekken? En wat gebeurt er wanneer het systeem een opdracht anders interpreteert dan de eigenaar bedoelde?
Hoe groter de bevoegdheden, hoe minder aantrekkelijk het model wordt waarin menselijke controle pas achteraf plaatsvindt.
Het echte conflict gaat over snelheid
Coxons waarschuwing is extreem. Hubingers persoonlijke risicoschatting is dat eveneens.
Maar juist Anthropics eigen onderzoek maakt het onmogelijk om het hele debat als sciencefiction weg te zetten.
Het bedrijf meet zelf hoe AI steeds meer werk binnen AI-ontwikkeling overneemt. Het publiceert regels voor modellen die vergaande onderzoekscapaciteiten krijgen en zegt dat recursieve zelfverbetering eerder kan verschijnen dan veel instellingen verwachten.
Wat niemand kan bewijzen, is dat de somberste uitkomst volgt.
Daarom draait deze breuk binnen Anthropic uiteindelijk niet om zekerheid.
Coxon vindt de onzekerheid groot genoeg om niet verder te bouwen. Anthropic vindt diezelfde onzekerheid reden om veiligheidsmaatregelen op te schalen terwijl de ontwikkeling doorgaat.
Als AI steeds meer helpt om de volgende AI te bouwen, wordt de vraag welke van die twee strategieën verstandig is alleen maar moeilijker.
Stop met te veel betalen voor je crypto. Bij de Amsterdamse exchange Finst handel je tegen de laagste tarieven van Nederland, zonder verborgen kosten.
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
Jacob Coxon
@hilbertspaess
The people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt. If anything, many executives and senior researchers will couch their phrasing in the press to sound sensible - but I hear the same people express fear
To be clear, as we say in our latest Risk Report (x.com/AnthropicAI/st…), I think the risk from present models is low. What I am worried about is superintelligence arising from recursive self-improvement, as we have said is happening faster than we thought
Anthropic
@AnthropicAI
As part of our Responsible Scaling Policy, we publish regular Risk Reports. These share detailed information on the risks of our systems and how prepared we are to address them.
Our second Risk Report is now available: anthropic.com/aug-2026-risk-…