NVIDIA AI-nieuws

Nvidia laat AI-agents goedkoper werken via slimme modelkeuze

kunstmatige intelligentie12 aug , 10:40
AI-agents hebben een kostenprobleem. Niet omdat één prompt duur is, maar omdat één opdracht soms tientallen modelrondes vreet.
Nvidia komt daarom met Nemotron 3.5 Lightning en NeMo Switchyard. De boodschap is simpel: stuur niet elke taak naar het duurste model.

Niet elke stap vraagt een topmodel

Een AI-agent werkt zelden in één rechte lijn. Hij leest bestanden, vat samen, roept tools aan, schrijft code, controleert fouten en probeert daarna opnieuw.
Sommige stappen vragen zwaar redeneerwerk. Andere stappen zijn gewoon uitvoerwerk.
Toch sturen veel systemen alles naar hetzelfde dure frontiermodel. Dat is alsof je een senior engineer vraagt om ook elk logbestand te hernoemen.
Switchyard probeert die verspilling te verminderen. De router kiest per stap welk model past bij de taak, de snelheid en de gewenste kwaliteit.

Nvidia wil de agentrekening aanvallen

Nvidia stelt dat modelrouting vooral telt bij langlopende agents. Daar loopt het aantal tokens snel op, omdat agents steeds plannen, tools gebruiken, resultaten teruglezen en opnieuw beslissen.
Nemotron 3.5 Lightning vult daarbij de goedkopere uitvoeringslaag. Het model telt 30 miljard parameters, maar activeert volgens Nvidia ongeveer 3 miljard parameters per token.
Dat mixture-of-experts-ontwerp betekent simpel gezegd: het hele model bestaat, maar per stap wordt maar een deel gebruikt. Dat kan rekentijd drukken zonder meteen alle capaciteit weg te gooien.
Volgens Nvidia haalt Lightning tot vier keer hogere output­snelheid dan vergelijkbare modellen. Op PinchBench zou het 10.000 agenttaken 30 procent sneller afronden dan Qwen3.6 35B bij vergelijkbare nauwkeurigheid.
Dat zijn Nvidia-benchmarks. Ze zijn nuttig, maar geen natuurwet.

Switchyard kiest tussen goedkoop en zwaar

De echte zet zit bij Switchyard.
De software kan verkeer tussen verschillende modellen sturen. Een eenvoudige stap kan naar een kleiner model. Een lastig plan of hardnekkige fout kan alsnog naar een frontiermodel.
Dat is belangrijk voor de economie van agents. De prijs wordt niet langer alleen bepaald door welk model je gebruikt, maar door hoe vaak je het zware model nodig hebt.
LangChain testte Switchyard op 145 multi-turn agenttaken. Volgens Nvidia leverde routing tussen Nemotron 3.5 Lightning en Claude Opus 4.8 een kostenreductie van 74 procent op. Slechts 7 procent van de aanvragen ging naar het frontiermodel. Daar stond een nauwkeurigheidsverlies van ongeveer zes punten tegenover.
Cognition zag in een codingtest met Devin Desktop ongeveer 28 procent lagere gemiddelde kosten. Ook daar ging het niet om gratis winst, maar om een ruil tussen prijs, snelheid en foutmarge.

Open router, maar nog experimenteel

Nvidia beperkt Switchyard niet tot eigen modellen. De GitHub-repository beschrijft een Rust-proxy die verkeer kan routeren en vertalen tussen OpenAI- en Anthropic-formaten.
De software kan ook werken met backends zoals vLLM, NVIDIA NIM, Ollama en OpenAI-compatible endpoints. Daarmee probeert Nvidia een plek te pakken tussen de agent en de modellen.
Dat is strategisch interessant. Wie bepaalt welk model wanneer wordt gebruikt, zit dicht op de kostenknop.
Maar er hangt een groot waarschuwingsbord aan.
Nvidia noemt Switchyard pre-alpha. De API’s en algoritmes kunnen nog stevig wijzigen. De repository waarschuwt expliciet dat de software experimenteel is en niet voor productiegebruik bedoeld is.
Dit is nog geen kant-en-klare bedrijfsoplossing. Het is een routekaart voor hoe agents goedkoper kunnen worden gebouwd.

Waarom crypto hier moet opletten

Nvidia lanceert geen cryptoproduct. Toch raakt dit aan stablecoins en machinebetalingen.
Een autonome agent koopt straks mogelijk compute, data, modeltoegang en API-diensten in. Niet één keer per maand, maar per taak, per tool en per microbeslissing.
Als die taken goedkoper worden, kunnen er meer van zulke agentprocessen draaien. Dan groeit ook de vraag naar betaalrails die automatisch, programmeerbaar en klein genoeg zijn voor machinegebruik.
Daar komt blockchain weer in beeld. Niet als hypewoord, maar als betaal- en afwikkellaag voor software die zelf diensten inkoopt.
Stablecoins kunnen daarin een rol krijgen, omdat ze digitale dollars of euro’s snel door programmeerbare systemen laten bewegen. Dat is geen garantie. Het is een mogelijke aansluiting.

De AI-agent krijgt een kostenlaag

De markt keek lang naar het beste model. Nvidia verschuift de vraag naar de beste combinatie.
Dat past bij waar agents naartoe gaan. Eén groot brein voor alles is duur. Een set modellen met een slimme verdeler kan goedkoper zijn, sneller reageren en lokaal meer controle geven.
Voor bedrijven telt straks minder welk model bovenaan de ranglijst staat. Ze gaan kijken welke taak naar welk model moet en hoeveel elke stap kost.
Voor crypto is de les even scherp.
AI-agents worden pas interessant voor machinebetalingen als hun eigen kosten niet alles opeten. Nvidia probeert precies die rekening kleiner te maken.
Niet met één wondermodel, maar met een router die zegt: deze taak hoeft niet naar de duurste tafel.

Stop met te veel betalen voor je crypto. Bij de Amsterdamse exchange Finst handel je tegen de laagste tarieven van Nederland, zonder verborgen kosten.

👀 Bekijk Finst nu

Let op: Beleggen in crypto brengt risico’s met zich mee. Handel alleen met geld dat u kunt missen.

Ga verder met lezen
loading
Dit vind je misschien ook leuk
Laat mensen jouw mening weten

Loading