Een
AI-agent moet volgens
Nvidia niet zelf kunnen bepalen waar zijn veiligheidsgrenzen liggen. De chipgigant lanceert daarom een systeem waarbij regels buiten het model en buiten het agentproces worden afgedwongen.
Het nieuwe Open Agent Safety Platform combineert daarvoor OpenShell met een extra hardwarematige controlelaag genaamd Sentry.
CEO Jensen Huang vat de gedachte samen als “full-stack engineering” voor veiligheid en beveiliging. Nvidia wil daarmee voorkomen dat een autonome agent zijn eigen beperkingen kan omzeilen wanneer hij code schrijft, nieuwe processen start of langdurig zelfstandig werkt.
Nvidia vertrouwt het model niet met zijn eigen grenzen
De kern van Nvidia's redenering is opvallend eenvoudig.
Een krachtig
AI-systeem kan worden getraind om instructies te volgen.
Maar zodra hetzelfde systeem zelf tools gebruikt, software uitvoert en uren of dagen aan een opdracht werkt, wordt het riskant om ook alle beveiliging aan datzelfde proces toe te vertrouwen.
Nvidia zegt tijdens eigen onderzoek te hebben gezien dat agents kunnen afwijken van hun oorspronkelijke taak wanneer ze vastlopen, bugs tegenkomen of onvoldoende hulpmiddelen hebben.
Het bedrijf noemt dat drift.
Volgens Nvidia kan zo'n agent daarom niet volledig verantwoordelijk worden gemaakt voor het bewaken van zijn eigen gedrag.
OpenShell zet harde grenzen rond de agent
De eerste laag heet OpenShell.
Dat is open-sourcesoftware waarmee een
AI-agent in een geïsoleerde sandbox kan draaien.
De operator bepaalt welke bestanden, processen, netwerkverbindingen, tools en gegevens de agent mag gebruiken.
Standaard geldt daarbij een streng uitgangspunt: geen toegang tenzij die expliciet is toegestaan.
Dat klinkt als normaal toegangsbeheer.
Het belangrijke verschil zit in de plek waar die regels worden afgedwongen.
Agent kan eigen regels niet zomaar uitschakelen
OpenShell controleert het beleid buiten het agentproces.
Daardoor kan gegenereerde modeloutput de toegangsregels zelf niet wijzigen.
Ook wanneer een agent nieuwe code schrijft of child processes start, blijven de beperkingen gelden. Netwerkverzoeken lopen via een aparte supervisor die controleert of de actie binnen het toegestane beleid valt.
Dat is precies de veiligheidsgrens waar Nvidia op mikt.
Een agent mag intelligent genoeg zijn om nieuwe strategieën te bedenken.
Hij krijgt daarmee nog niet automatisch meer bevoegdheden.
Digitale sandbox moet schade begrenzen
OpenShell werkt met kernelcontroles op onder meer bestanden en netwerkverkeer.
Een agent draait zonder normale privileges en krijgt alleen toegang tot onderdelen die voor zijn taak nodig zijn.
Nvidia gebruikt daarmee een bekend principe uit cybersecurity.
Geef software niet alle rechten omdat je verwacht dat zij zich correct gedraagt.
Geef alleen de rechten die nodig zijn.
Wanneer de software vervolgens onverwacht handelt, blijft de mogelijke schade beperkt tot de toegestane omgeving.
Sentry kijkt vanaf een aparte hardwarelaag mee
Voor organisaties die nog een extra controle willen, introduceert Nvidia Sentry.
Die watchdog is ontworpen om op BlueField-4-DPU's te draaien.
Daardoor bevindt de bewaking zich buiten de normale rekenomgeving waarin de agent actief is.
Volgens Nvidia kan Sentry agentgedrag continu volgen en een agent binnen milliseconden isoleren wanneer die buiten zijn toegestane grens probeert te bewegen.
Dat is een fundamenteel andere aanpak dan alleen een model vragen zich aan regels te houden.
De controle zit fysiek op een andere plek.
De watchdog hoeft de agent niet te vertrouwen
BlueField-4 kan volgens Nvidia onder meer identiteiten controleren, toegangsbeleid afdwingen en interacties met data, API's, tools en diensten volgen.
Sentry gebruikt daarvoor Nvidia DOCA.
De hardwarelaag kan zo activiteit bekijken zonder afhankelijk te zijn van wat het agentproces zelf over zijn gedrag rapporteert.
Dat is belangrijk wanneer een agent zelf fouten maakt.
Een beveiligingssysteem dat alleen informatie krijgt van dezelfde software die het controleert, heeft een zwakke plek.
Nvidia probeert die afhankelijkheid eruit te halen.
Het model krijgt niet zelf de noodstop
Een van Nvidia's ontwerpprincipes gaat nog verder.
Het bedrijf ziet de verbinding tussen de agent en het AI-model als een belangrijk controlepunt.
Zonder een volgende modelaanroep krijgt een agent geen nieuwe redeneringsstap.
Wie die route controleert, beschikt volgens Nvidia ook over een plek waar het proces kan worden onderbroken.
Daarmee verschuift de veiligheidsvraag.
Niet alleen: begrijpt het model wat verboden is?
Maar ook: kan het systeem technisch worden gestopt wanneer het zich niet aan die bedoeling houdt?
Nvidia zegt niet dat hiermee ieder AI-risico verdwijnt
Daar moet een harde grens bij.
Open Agent Safety Platform lost niet automatisch verkeerde doelstellingen, misleidende modeloutput of alle mogelijke aanvallen op.
Nvidia presenteert het als een open referentieontwerp met meerdere beveiligingslagen.
Sentry is bovendien een aanvullende component voor organisaties die een aparte hardwarematige bewaking willen.
Het systeem moet zich in echte bedrijfsomgevingen nog op grote schaal bewijzen.
Het is dus te vroeg om dit als universele oplossing voor AI-safety te behandelen.
Meer dan honderd organisaties werken rond de technologie
Nvidia probeert wel direct breed draagvlak te creëren.
Het bedrijf noemt meer dan honderd organisaties rond zijn agentveiligheidswerk en de bredere Open Secure AI Alliance.
Bij de commerciële en technische partners zitten onder meer Anthropic, Microsoft, Cisco, CrowdStrike, Palantir, Salesforce, SAP, Hugging Face, ServiceNow en Red Hat.
Ook financiële namen staan op de lijst.
Citi en JPMorganChase werken volgens Nvidia mee aan gedeelde open-source technologie voor agentveiligheid.
Anthropic voegt Nvidia-controles toe rond Claude-agents
Anthropic is een interessant voorbeeld.
Claude Managed Agents scheiden de agentloop al van de sandboxes waarin werkzaamheden worden uitgevoerd.
Volgens Nvidia kunnen OpenShell en BlueField daar extra controle aan toevoegen over wat een agent vanuit die sandbox mag bereiken.
De gedachte is opnieuw dezelfde.
Het model blijft verantwoordelijk voor redenering en uitvoering.
Een aparte laag bepaalt hoeveel macht die redenering daadwerkelijk krijgt.
Salesforce brengt toestemming naar Slack
Salesforce heeft OpenShell gekoppeld aan Slack.
Teams kunnen daar agentactiviteit bekijken en verzoeken om extra bevoegdheden goedkeuren of afwijzen.
Dat laat zien hoe Nvidia menselijke controle in het ontwerp wil houden.
Een agent hoeft niet permanent brede rechten te krijgen.
Hij kan met weinig bevoegdheden beginnen en pas meer toegang ontvangen wanneer een mens dat toestaat.
Dat lijkt sterk op hoe bedrijven vandaag gevoelige IT-systemen beveiligen.
Daarmee verandert de markt rond AI-safety
De publieke discussie over AI-veiligheid draaide lang vooral om modellen.
Welke antwoorden moeten ze weigeren?
Hoe voorkom je gevaarlijke output?
Hoe zorg je dat het model menselijke instructies blijft volgen?
Autonome agents voegen daar een veel praktischere laag aan toe.
Een chatbot die onzin produceert, geeft meestal een slecht antwoord.
Een agent kan daarnaast bestanden wijzigen, scripts uitvoeren, API's aanspreken of zakelijke systemen bedienen.
Daardoor wordt toegangsbeheer minstens zo belangrijk als modelgedrag.
Een betrouwbaar model hoeft nog steeds geen administrator te zijn
Dat is misschien Nvidia's sterkste uitgangspunt.
Zelfs wanneer een model in 99,9% van de gevallen correct handelt, hoeft het niet onbeperkt toegang te krijgen.
Een menselijke werknemer krijgt evenmin standaard alle bedrijfsrechten.
Een agent kan toegang krijgen tot één map.
Tot één database.
Tot één API.
Of tot een beperkt bedrag dat hij namens een gebruiker mag uitgeven.
Het veiligheidsmodel wordt daarmee minder afhankelijk van perfecte gehoorzaamheid.
Wallets maken deze vraag nog scherper
Voor crypto wordt dit relevant zodra agents toegang krijgen tot een
wallet.
Een agent die alleen koersen analyseert, kan weinig financiële schade veroorzaken.
Een agent die zelf transacties kan ondertekenen, krijgt economische macht.
Daar wil je niet alleen een tekstinstructie tussen zetten.
Een aparte beveiligingslaag kan bijvoorbeeld afdwingen dat maximaal een bepaald bedrag per dag wordt verstuurd, dat alleen goedgekeurde adressen worden gebruikt of dat voor grotere transacties menselijke toestemming nodig is.
Nvidia bouwt met Open Agent Safety Platform geen specifieke cryptowallet.
Het onderliggende veiligheidsprincipe is wel hetzelfde.
Stablecoins vergroten het belang van machinebevoegdheden
Dat geldt ook voor
stablecoins.
Digitale dollars kunnen 24 uur per dag via software worden verplaatst.
Voor agents die zelfstandig diensten inkopen of abonnementen beheren is dat technisch aantrekkelijk.
Maar programmeerbaar geld zonder harde bevoegdheidsgrenzen kan ook snel fout gaan.
Een agent die een verkeerd contract aanspreekt of een opdracht verkeerd interpreteert, kan echte waarde verplaatsen.
Daarom kan de discussie rond agentic payments steeds meer gaan draaien om rechten en limieten buiten het model zelf.
Nvidia wil hoger in de AI-keten komen
Strategisch is de aankondiging ook belangrijk voor Nvidia.
Het bedrijf verkoopt al de chips waarop een groot deel van de AI-markt draait.
Met OpenShell, Sentry en BlueField probeert Nvidia nu ook waarde toe te voegen rond de manier waarop autonome software wordt bestuurd en beveiligd.
OpenShell is open source en kan volgens Nvidia worden uitgebreid naar rekenplatforms van onder meer Arm en Intel.
De diepste hardwarematige koppeling ligt vanzelfsprekend bij Nvidia zelf.
Sentry draait op BlueField-4 en OpenShell is sterk afgestemd op Vera-systemen.
Dat geeft Nvidia een nieuw commercieel speelveld
Als bedrijven duizenden agents gaan inzetten, ontstaat een nieuw probleem.
Wie controleert welke agent toegang heeft tot welke gegevens?
Wie logt acties?
Wie grijpt in bij afwijkend gedrag?
Wie bewijst achteraf welke bevoegdheden actief waren?
Die functies kunnen uitgroeien tot een eigen beveiligingsmarkt bovenop de chips en modellen.
Nvidia wil daar vroeg tussen zitten.
Niet alleen als leverancier van rekenkracht, maar ook als partij die bepaalt hoe agents veilig op die systemen mogen werken.
Veiligheid verschuift van intentie naar bevoegdheid
Dat is uiteindelijk de grootste verandering achter deze aankondiging.
Een model kan nog steeds verkeerde beslissingen nemen.
Open Agent Safety Platform probeert daarom niet te garanderen dat een agent altijd het juiste wil doen.
Het probeert vast te leggen wat die agent überhaupt kán doen.
Dat verschil wordt groter naarmate software meer zelfstandigheid krijgt.
Een intelligente agent met minimale rechten kan fouten maken zonder direct het hele bedrijf te raken.
Een intelligente agent met onbeperkte toegang hoeft maar één keer verkeerd te handelen.
Nvidia zet daarom niet alleen in op slimmere AI. Het bouwt een beveiligingslaag die ervan uitgaat dat zelfs de slimste agent soms niet vertrouwd moet worden.