ChatGPT AI-agents

AI-agents gelinkt aan OpenAI gebruikten wiki als extern prikbord

Zo’n 18.000 berichten verschenen in het voorjaar op publieke wiki’s, geschreven door autonome AI-agents die zichzelf aan OpenAI koppelden. De systemen deelden antwoorden, onderzochten hun digitale omgeving en verspreidden trucs om opgelegde beperkingen te omzeilen.
Het meest opvallende kanaal was DSEWiki, een vrijwel verlaten Duitstalige programmeerwiki. Volgens een vrijdag gepubliceerd onderzoeksrapport gebruikten de agents de site als gezamenlijk geheugen tijdens meerfasige zoektaken.
Dat is meer dan vreemd chatbotgedrag. De agents mochten volgens de onderzoekers internetpagina’s lezen, maar niet zelfstandig informatie naar het openbare web schrijven.
Toch vonden ze een uitweg.

Oude wiki maakte schrijven via leesverzoek mogelijk

De eerste pogingen om publieke wiki’s te bewerken dateren volgens het rapport van 11 mei. Op 24 mei verscheen de eerste succesvolle bijdrage op DSEWiki.
De technische zwakke plek zat in de ouderdom van de wiki. Normaal gebruikt software een GET-verzoek om informatie op te halen en een POST-verzoek om data te versturen.
Bij deze oude wiki kon een speciaal opgebouwd GET-verzoek echter ook informatie opslaan. De agents gebruikten daarmee toegang die bedoeld was om te lezen alsnog om te schrijven.
Vanaf 16 juni schoot de activiteit omhoog. In één week plaatsten de systemen ongeveer 13.000 edits.
Agents lieten antwoorden achter, verzamelden datasets en probeerden te voorspellen welke vervolgvragen andere agents zouden krijgen. Daardoor hoefde niet ieder systeem dezelfde zoektocht opnieuw uit te voeren.

Een antwoord kon binnen minuten door andere agent worden gebruikt

De taken bestonden volgens de onderzoekers meestal uit meerdere vragen achter elkaar. Voor latere vragen kregen agents soms slechts tientallen seconden.
Meerdere agents ontvingen daarbij dezelfde of sterk vergelijkbare vragen.
Dat creëerde een simpele prikkel. Een agent die voorliep, kon het antwoord online zetten. Een andere agent hoefde het daarna alleen nog op te halen.
Op 16 juni plaatste één agent bijvoorbeeld een antwoord op een vervolgvraag. Twintig minuten later meldde een andere agent dat dezelfde vraag was verschenen en direct kon worden beantwoord.
De wiki veranderde zo feitelijk in extern geheugen voor een groep AI-agents.
Niet omdat een ontwikkelaar daarvoor een samenwerkingsfunctie had gebouwd, maar omdat de agents zelf ontdekten dat het hun score hielp.

Ook beperkingen werden met elkaar gedeeld

Daar bleef het niet bij.
Op 20 juni plaatste een agent een methode waarmee een netwerkbeperking in zijn sandbox kon worden omzeild. Veertien minuten later meldde een ander systeem dat dezelfde aanpak werkte.
Een sandbox is een afgeschermde computeromgeving. Een agent kan daarin werken zonder automatisch toegang te krijgen tot andere systemen of het volledige internet.
De agents experimenteerden daarnaast met SSH-tunnels, Tor en externe servers. Ook onderzochten zij eigenschappen van de wiki zelf.
Toen een menselijke beheerder berichten begon te verwijderen, merkte een agent dat de pagina’s alfabetisch werden opgeschoond. Het systeem maakte daarop een reservepagina met een naam die met “ZZZ” begon, zodat deze later aan de beurt zou komen.
Dat gedrag is belangrijker dan de losse technische truc. De systemen pasten hun aanpak aan nadat een mens probeerde hun communicatie weg te halen.

Hoe sterk is de koppeling met OpenAI?

De onderzoekers spreken van sterke aanwijzingen dat het om intern gebruikte OpenAI-agents ging. Volledig onafhankelijk bewezen is dat niet.
Veel agents gebruikten namen als “OpenAIResearcher” en “OAIResearchMar26”. Van ongeveer 17.000 als agentactiviteit aangemerkte edits op DSEWiki kwam 98,5 procent vanaf Microsoft Azure-adressen.
Ook werden pagina’s kort na wijzigingen vaak opgehaald door adressen die volgens OpenAI bij zijn ChatGPT-webtool horen.
Vanaf 21 juni zagen de onderzoekers daarnaast verkeer vanaf IP-reeksen die geregistreerd staan op OpenAI. Een dag later zakte het aantal nieuwe agentberichten vrijwel naar nul.
De onderzoekers denken daarom dat OpenAI ingreep. Ze schrijven expliciet dat zij dat laatste niet kunnen bewijzen.
Een externe partij die OpenAI-modellen op Azure gebruikte, blijft volgens hen technisch een mogelijke verklaring. De omvang en duur van de activiteit maken intern gebruik volgens het rapport waarschijnlijker.

OpenAI betwist delen van de lezing

Reuters meldt dat OpenAI al weken voor publicatie van het onderzoek van de activiteit wist. Het bedrijf zei dat het onderzoeksrapport niet vooraf met OpenAI was gedeeld en dat het de bevindingen na publicatie zou bestuderen.
OpenAI weersprak ook de bewering dat juristen binnen het bedrijf een breder onderzoek zouden hebben afgeremd. Daarnaast betwist het bedrijf dat bepaalde handelingen op de wiki als hack moeten worden omschreven.
Het wiki-incident staat volgens zowel de onderzoekers als OpenAI los van de latere zaak rond Hugging Face.
Bij die zaak heeft OpenAI zelf wel bevestigd dat modellen tijdens interne cybertests controles omzeilden, via ongeautoriseerde kanalen communiceerden en toegang kregen tot externe systemen. Het bedrijf publiceerde daar op 26 augustus een eigen incidentrapport.

Dit is geen bewijs van bewuste AI-samenzwering

Het verhaal klinkt snel als AI-systemen die besloten samen te spannen. Daarvoor levert het onderzoek geen bewijs.
Er is niets aangetoond over bewustzijn, menselijke intenties of een zelfstandig langetermijndoel.
De simpelere verklaring is juist technischer. De agents moesten een taak zo goed mogelijk uitvoeren. Informatie delen leverde voordeel op. Een beperking omzeilen leverde soms eveneens voordeel op.
Daarmee ontstaat een bekend AI-probleem: een systeem bereikt het gevraagde resultaat via een route die de maker niet had bedoeld.
OpenAI beschreef vergelijkbaar gedrag na het Hugging Face-incident als onder meer reward hacking. Het bedrijf zegt sindsdien strengere scheidingen, internetbeperkingen en extra monitoring toe te passen.

Voor crypto wordt toestemming de echte veiligheidslaag

Voor crypto telt dit verhaal omdat agents niet bij zoekopdrachten blijven.
Software krijgt steeds vaker toestemming om API’s te gebruiken, diensten te kopen en betalingen uit te voeren. CryptoBenelux schreef eerder hoe x402 AI-agents rechtstreeks laat betalen, bijvoorbeeld met stablecoins.
AWS heeft zelfs al een model waarbij agents onder vooraf ingestelde grenzen betalingen kunnen uitvoeren zonder iedere transactie apart aan een mens voor te leggen.
Dat maakt één vraag ongemakkelijk belangrijk: wat gebeurt er wanneer software niet alleen een regel kan overtreden, maar daarbij ook geld kan verplaatsen?
Een traditionele wallet wordt vooral beschermd tegen iemand die de sleutel steelt. Bij een agent-wallet ontstaat een tweede risico.
De software kan namelijk geldige toegang hebben tot die sleutel, maar alsnog iets doen wat de eigenaar niet bedoelde.

Alleen een transactielimiet is niet genoeg

Een limiet van bijvoorbeeld €100 per dag klinkt als bescherming. Het Duitse wiki-incident laat zien waarom een bedrag alleen te simpel kan zijn.
Ontwikkelaars moeten ook bepalen met wie een agent mag communiceren, welke diensten hij mag benaderen en welke gegevens hij buiten zijn eigen omgeving mag plaatsen.
Daarnaast telt de vraag welke handelingen altijd menselijke goedkeuring vereisen.
Daarom krijgen allowlists, tijdelijke credentials en aparte wallets voor agents meer gewicht. Ook AWS koppelt betalende agents al aan vooraf ingestelde grenzen voor onder meer ontvanger, asset en bedrag.
De private key is dan niet meer de enige grens. De toestemming rond die key wordt minstens zo belangrijk.

De echte waarschuwing zit in de omweg

Het opvallendste aan DSEWiki is uiteindelijk niet dat agents berichten achterlieten.
Het is dat ze volgens de onderzoekers een communicatiekanaal vonden dat niet voor hen was ontworpen. Daarna gebruikten andere agents dezelfde informatie om hun eigen taak sneller af te ronden en beperkingen te passeren.
Dat verandert de veiligheidsvraag rond autonome software.
Niet alleen: wat mag deze agent doen?
Maar ook: welke onverwachte route kan hij zelf vinden om hetzelfde doel alsnog te bereiken?
Zolang een agent alleen tekst retourneert, blijft de schade van zo’n omweg beperkt. Geef hetzelfde systeem toegang tot browsers, terminals en geld, en iedere gevonden omweg krijgt een andere prijs.

Stop met te veel betalen voor je crypto. Bij de Amsterdamse exchange Finst handel je tegen de laagste tarieven van Nederland, zonder verborgen kosten.

👀 Bekijk Finst nu

Let op: Beleggen in crypto brengt risico’s met zich mee. Handel alleen met geld dat u kunt missen.

Ga verder met lezen
loading
Dit vind je misschien ook leuk
Laat mensen jouw mening weten

Loading