Anthropic AI angst

Coinbase ziet nieuwere AI-modellen juist meer fraude missen in test

kunstmatige intelligentie•
Nieuwere AI bleek bij Coinbase niet automatisch beter in fraudedetectie. In drie onderzochte modelfamilies vonden de nieuwere versies minder echte fraude en een kleiner deel van het totale fraudebedrag.
Coinbase publiceerde de resultaten op 7 oktober. Het bedrijf testte zes modellen op exact dezelfde 16.140 historische transacties. Daarvan waren 813 transacties bevestigd als fraude.
De uitkomst raakt een lastig probleem voor financiële bedrijven: een modelupgrade kan technisch nieuwer zijn, maar tegelijk de grens tussen verdacht en normaal gedrag anders leggen.

Coinbase hield de test voor alle modellen gelijk

De dataset bevatte transacties van 7.293 gebruikers uit een periode van negen weken.
Coinbase koos historische transacties van vóór de invoering van zijn nieuwe fraude-agent. Daardoor konden eerdere blokkades door het systeem de uiteindelijke uitkomsten niet beïnvloeden.
Alle modellen kregen dezelfde transacties, dezelfde recente gedragsinformatie en dezelfde regels waarmee een risicoscore werd vertaald naar een beslissing.
Het bedrijf vergeleek Opus 4.5 met Opus 5, Sonnet 4.6 met Sonnet 5 en GPT-5.4 met GPT-5.6 (sol).
Bij alle drie de families scoorde de nieuwere versie lager op recall, F1 en dollar-weighted recall.

Minder valse alarmen kan toch slechter uitpakken

Dat klinkt tegenstrijdig totdat de meetmethodes uit elkaar worden gehaald.
Precision meet welk deel van de fraudemeldingen werkelijk fraude was. Recall meet juist hoeveel van alle echte fraudegevallen het systeem wist te vinden. De F1-score combineert beide.
Stel dat honderd fraudegevallen bestaan.
Model A meldt twintig transacties, waarvan tien terecht. Model B meldt slechts vijf transacties en heeft ze alle vijf goed.
Model B heeft dan een veel hogere precision. Toch mist het 95 van de honderd fraudegevallen.
Voor een crypto-exchange kan dat verschil financieel zwaar wegen. Minder onterechte blokkades zijn prettig voor klanten, maar niet wanneer grote hoeveelheden echte fraude ongezien doorgaan.

GPT-5.6 gaf preciezere alarmen maar miste meer fraude

Bij GPT liep precies die afweging uiteen.
GPT-5.6 (sol) verbeterde de precision volgens Coinbase met 11,5 procentpunt tegenover GPT-5.4. Wanneer het model fraude aanwees, zat het dus vaker goed.
De recall daalde echter met 20,7 procentpunt.
Ook de dollar-weighted recall zakte met 21,8 procentpunt. Dat betekent dat het nieuwere model een kleiner deel van de totale financiële waarde achter de bevestigde fraude herkende. De F1-score ging eveneens omlaag.
Coinbase noemt dit geen bewijs voor de oorzaak. Het bedrijf stelt alleen vast dat GPT-5.6 binnen deze vaste test anders classificeerde.
Een mogelijke verklaring is dat het model terughoudender werd met het label fraude. Dat past bij hogere precision en lagere recall, maar Coinbase zegt de verandering niet aan een specifieke trainingskeuze te kunnen koppelen.

Sonnet verloor ruim 22 punten aan recall

Bij de twee andere modelfamilies was het beeld nog duidelijker.
Opus 5 en Sonnet 5 scoorden beide lager dan hun voorganger op alle vier de gemeten onderdelen. Daar was dus niet eens sprake van hogere precision als compensatie.
Bij Opus bleef de daling in recall beperkt tot 0,8 procentpunt.
Bij Sonnet was het verschil veel groter. De recall van Sonnet 5 lag 22,2 procentpunt lager dan die van Sonnet 4.6. De dollar-weighted recall verloor 22,9 procentpunt.
Het nieuwere Sonnet-model vond binnen deze test dus niet alleen minder fraudegevallen. Het miste ook een groter deel van het geld dat met die fraude gemoeid was.

Fraudebedrag vertelt iets anders dan aantal incidenten

Coinbase meet daarom naast het aantal ontdekte fraudegevallen ook hoeveel fraudewaarde een model tegenhoudt.
Dat verschil kan fors zijn.
Een detector kan negen fraudegevallen van $100 vinden en één transactie van $100.000 missen. Op basis van aantallen heeft het systeem dan 90 procent van de fraude opgespoord.
Financieel is bijna alle schade toch door de controle geglipt.
Daarom gebruikt Coinbase dollar-weighted recall: het aandeel van de totale fraudewaarde dat daadwerkelijk wordt herkend.
Voor betalingssystemen is dat een andere vraag dan alleen hoeveel transacties correct worden gelabeld.

AI-agent stond boven op bestaande frauderegels

De onderzochte AI-modellen werkten ook niet als enige verdedigingslaag.
Coinbase beschrijft zijn fraude-agent als een extra controle nadat bestaande machine-learningmodellen en vaste regels hun werk al hebben gedaan. De agent kijkt vervolgens naar recent transactiegedrag en geeft een aanvullende risicobeoordeling.
Dat maakt het verschil met een algemene AI-benchmark groot.
Een model kan uitstekend zijn in programmeren, schrijven of redeneren en toch minder goed passen bij de specifieke beslisgrens die een betaalbedrijf voor fraude gebruikt.
Coinbase trekt daarom de conclusie dat een upgrade eerst op eigen bedrijfsdata moet worden getest voordat een nieuwer model een ouder model vervangt.

Geen ranglijst van beste AI-modellen

De resultaten zeggen alleen iets over deze Coinbase-opstelling.
Het gaat om historische transacties, één fraudetaak en vaste beslisregels. Coinbase heeft de modellen niet getest op algemene intelligentie of op alle mogelijke vormen van financiële fraude.
Ook meet deze vergelijking niet rechtstreeks wat er zou gebeuren wanneer ieder model afzonderlijk live bij klanten werd ingezet.
Een andere prompt, aangepaste grenswaarde of andere fraudedata kan de uitkomst veranderen.
Daarom is “nieuwere AI is slechter” een te brede conclusie.
Wat Coinbase wel laat zien, is smaller en bruikbaarder: een nieuwer model kan binnen precies hetzelfde fraudebeleid andere keuzes maken en daardoor financieel slechter uitpakken.
Voor banken, betaalbedrijven en cryptoplatformen zit daar de waarschuwing. Een modelnummer upgraden is eenvoudig. Bewijzen dat het nieuwe model ook minder geld door fraude laat verdwijnen, vraagt een afzonderlijke test.

Stop met te veel betalen voor je crypto. Bij de Amsterdamse exchange Finst handel je tegen de laagste tarieven van Nederland, zonder verborgen kosten.

👀 Bekijk Finst nu ›

Let op: Beleggen in crypto brengt risico’s met zich mee. Handel alleen met geld dat u kunt missen.

Ga verder met lezen
loading
Dit vind je misschien ook leuk
Laat mensen jouw mening weten

Loading