22 september 2026 · 5 min leestijd

Jev maakt kleine AI-beslissingen goedkoop, en dat maakt een groot verschil

TypeSafe introduceerde Jev op 15 september. Wat mij eraan bevalt, is eigenlijk vrij alledaags: het zou de kleine beslissingen binnen een app zo goedkoop kunnen maken dat je ze overal kunt inzetten.

Neem een kapotte waterkoker. Je stuurt de winkel: "Het handvat is in de doos afgebroken. Kunnen jullie een nieuwe sturen?" Software moet de klacht begrijpen, bepalen wat je wilt en het dossier bij de juiste mensen krijgen. Daar zou ik Jev voor proberen.

Kleine vragen, bruikbare antwoorden

Jev is TypeSafe's eerste "System One"-model. Je geeft informatie en gerichte vragen mee; het geeft beslissingen en waarschijnlijkheden terug. Een antwoord aan je klant schrijft het niet.

Er zijn drie vraagtypes:

Type Wat je vraagt Wat je terugkrijgt
Choice Welk probleem uit deze lijst? Eén optie, waarschijnlijkheden voor de opties en confidence
Score Hoe dringend is dit volgens deze beschreven niveaus? Een naar waarschijnlijkheid gewogen score, de waarschijnlijkheden per niveau en confidence
Noul Vraagt dit bericht om een vervanging? Een waarschijnlijkheid van 0 tot 1, zonder apart confidence-veld

Bij de waterkoker kan Choice met aparte vragen "beschadigd artikel" en "vervanging gevraagd" herkennen. Code controleert daarna de echte bestelling en de regels voor vervanging. De database heeft nog steeds werk. Degene die een nieuwe waterkoker moet zoeken ook.

Probeer nu eens: "Hij kwam kapot aan en jullie hebben me twee keer laten betalen." Dwing je dat in precies één klachtcategorie, dan ben je de helft van het probleem kwijt. Ook goedkope beslissingen vragen om een doordachte werkwijze.

Je kunt onafhankelijke vragen samen stellen en de relevante antwoorden in code gebruiken. De vragen zien elkaars antwoorden niet. Voor alles wat afhangt van informatie die je daarna ophaalt, blijft een extra stap nodig.

De prijs maakt het interessant

TypeSafe vermeldt momenteel Jev 1.13 voor $0,042 per miljoen input tokens, zonder kosten voor output tokens. Het verwerkt tekst, ook gestructureerde tekstgegevens. Foto's en audio moet je eerst omzetten.

Ter illustratie: 10.000 verzoeken met gemiddeld 1.000 factureerbare input tokens kosten $0,42 aan Jev-input. Tel de vragen en antwoordopties mee. Informatie ophalen, andere modellen, herhaalde pogingen en menselijke controle komen daar nog bij.

Voor dat bedrag zou ik overwegen om schoolmails te markeren die een antwoord vragen of een gewijzigde afspraak aankondigen. Om er een agenda-afspraak van te maken, moet je nog datums uit de tekst halen en controleren. "Vrijdag" heeft al genoeg ellende veroorzaakt.

Een huisassistent kan de kamer, het apparaat en de actie kiezen uit "Doe het licht in de keuken uit." De applicatie koppelt die antwoorden aan echte apparaten. TypeSafe's smarthomedemo combineert Jev al met een LLM voor gesprekken en samengestelde verzoeken. Een demo laat zien hoe de onderdelen samenwerken, niet hoe betrouwbaar ze bij iemand thuis zijn.

Redeneermodellen hebben nog genoeg te doen

Vergelijk "Welke afdeling behandelt deze klacht?" met "Sinds we van leverancier veranderden, krijgen we dubbel zoveel retouren; zoek uit waarom." Dat tweede vraagt om bewijs, berekeningen, verschillende verklaringen en een aanbeveling.

Daar zou ik mijn systeem op bouwen: een beslismodel voor eenvoudige interpretatie, code voor regels en acties, en een redeneermodel voor ingewikkelde analyses. Een generatief model kan het antwoord schrijven als een sjabloon niet volstaat.

Goedkopere controles kunnen een assistent ook meer eigen conceptantwoorden laten nakijken. Bijvoorbeeld of een beloofde terugbetaling strookt met het meegegeven beleid. Je moet wel meten of die controle fouten oppikt. Niemand heeft iets aan een extra model dat vol vertrouwen foute antwoorden goedkeurt.

Een geldig antwoord kan nog steeds fout zijn

De claim bij de lancering dat het "niet kan hallucineren" vraagt om uitleg. Een model dat alleen retouren, verzending en facturatie mag kiezen, kan geen vierde afdeling verzinnen. Het kan wel de verkeerde kiezen. Bestaande LLM's hebben ook mogelijkheden voor gestructureerde output. Een geldige structuur en juiste waarden zijn twee aparte problemen.

TypeSafe noemt de trainingsaanpak Reinforcement Learning for Calibrated Decisions, of RLCD. Het doel: waarschijnlijkheden die overeenkomen met de uitkomsten. Van vergelijkbare voorspellingen met 80% waarschijnlijkheid zou ongeveer 80% moeten kloppen. Dat meet je over veel gevallen. Het is geen belofte over jouw waterkoker.

Jevs aparte confidence-veld vat voor Choice en Score samen hoe de waarschijnlijkheden verdeeld zijn. Het is niet de waarschijnlijkheid van de gekozen optie of een gegarandeerd nauwkeurigheidspercentage. Een drempelwaarde moet je op je eigen voorbeelden testen.

Wat de eerste tests echt laten zien

LiteLLM testte 80 zelfgeschreven prompts, drie keer per classifier. Jev 1.13 had een mediane classificatietijd van 126,81 ms tegenover 688,40 ms voor Claude Haiku 4.5, ongeveer 5,43 keer zo snel. De labels zijn niet onafhankelijk gecontroleerd. De test mat ook niet de kwaliteit van de uiteindelijke antwoorden.

LangChain beoordeelde vijf uitvoeringstraces van een weeragent, elk 100 keer. Jev kwam bij al die herhalingen overeen met de menselijke beoordelingen van geslaagd of mislukt en gaf consistente scores. Bemoedigend, maar vijf voorbeelden die je 100 keer herhaalt, blijven vijf voorbeelden.

Ik zie beide als redenen om een proef te doen. TypeSafe's eigen pagina met beperkingen noemt zwakke punten bij rekenen, datums, indirect redeneren, irrelevante context en misleidende input. Die zouden allemaal in mijn testset zitten.

Waar ik zou beginnen

Als je een team leidt: probeer suggesties op oude supporttickets voordat je het doorsturen automatiseert. Tel verkeerde bestemmingen, gevallen die controle nodig hebben en bespaarde tijd. Neem berichten met meerdere problemen mee.

Als je code schrijft: vergelijk met je huidige aanpak en een klein LLM met beperkte antwoordopties. Zet de Jev-versie vast, houd een aparte testset voor de eindbeoordeling en controleer fouten bij automatisch geaccepteerde gevallen. Reken de kosten van terugvalopties en het herstellen van fouten mee.

Ik wil meer software die een rommelig verzoek begrijpt en bij de juiste mensen krijgt. Daar lijkt Jev me het testen waard. De klant met de kapotte waterkoker bepaalt of we er iets op vooruit zijn gegaan.


Bronnen staan door de tekst heen gelinkt. Gecontroleerd op 22 september 2026. Mogelijkheden en prijzen komen van TypeSafe; de externe tests gaan over beperkte taken. Voorbeelden en kostenberekeningen zijn illustratief.