DruckFin

TypeSafe's Jev verwerkt 1 biljoen tokens per dag terwijl oprichter benchmarks, weigering en RLHF afwijst voor een nieuwe AI-categorie

Een interview tijdens de lanceerweek onthult de technische filosofie en zakelijke keuzes achter "systeem één"-AI-modellen, gericht op machines in plaats van chatbots

TypeSafe, de AI-startup opgericht door voormalig OpenAI-onderzoeker Diogo, heeft bij de lancering van zijn nieuwe modellijn Jev een in eigen ogen geheel nieuwe categorie kunstmatige intelligentie geïntroduceerd: "systeem één-modellen", ontworpen om door code te worden geconsumeerd in plaats van door mensen. In een uitgebreid interview tijdens de lanceerweek legde Diogo een reeks ongebruikelijk directe standpunten neer over benchmarks, veiligheidsalignment, fine-tuning en de huidige staat van geavanceerd AI-onderzoek. Investeerders die de sector volgen, zullen hier nota van willen nemen, ongeacht of ze het bedrijf uiteindelijk financieren.

Een nieuwe modelcategorie, gebouwd voor machines, niet voor chatbots

De kernhypothese van TypeSafe is dat de hele industrie grote taalmodellen voor de verkeerde consument heeft geoptimaliseerd. Voorgetrainde modellen werden gebouwd voor autosuggestie, door RLHF getunede chatbots zoals ChatGPT en Claude werden gebouwd om menselijke beoordelaars tevreden te stellen, en redeneermodellen die met RLVR waren geoptimaliseerd, werden gebouwd om benchmarkbare problemen op te lossen. Jev, zo stelt Diogo, is het eerste model dat expliciet is gebouwd zodat "code de consument is". Hij omschreef het als "machinenatieve, groot, programmeerbaar" en gaf aan dat de naam — een verwijzing naar de paradox van Jevons — de unieke focus van het bedrijf op intelligentie per dollar weerspiegelt. "Jev zal de naam zijn van modellen die aan de frontlinie staan van intelligentie per dollar", zei hij. Hij voegde eraan toe dat betrouwbaarheid, kosten, kalibratie en snelheid op spanning staan en dat TypeSafe ervoor heeft gekozen om specifiek "voluit" te gaan op de as van intelligentie per dollar.

Het bedrijf kader dit in als het oplossen van wat Diogo de centrale paradox van het huidige AI-tijdperk noemt: modellen die in staat zijn wiskundige problemen op het niveau van de millenniumprijzen op te lossen, kunnen nog steeds geen basale, repetitieve kantoortaken automatiseren. "We hebben deze opgevoerde automatiseringsmotor die simpelweg niet de juiste aansluitingen heeft om al dit economisch waardevolle werk aan te sturen", zei hij. Volgens hem is de kloof geen capaciteitsprobleem, maar een ontwerp- en interfaceprobleem.

Adoptiecijfers overtreffen de eigen verwachtingen van het bedrijf

Wellicht het meest concrete datagpunt uit het interview: Jev heeft reeds de grens van 1 biljoen verwerkte tokens per dag gepasseerd. Diogo benadrukte dat dit cijfer een weerspiegeling is van echt machine-naar-machine-gebruik dat continu draait, "zelfs 's nachts", in plaats van eenmalige menselijke tests. De lanceervideo zelf heeft inmiddels 38 miljoen weergaven getrokken. Diogo's co-host merkte op dat dit hem op wekelijkse basis voor plaatst op Nvidia's veelbekeken keynote-momenten van Jensen Huang (74 miljoen in totaal) en voor andere recente grote tech-lanceringen zoals de demo van Fable (57 miljoen).

Daar tegenover stond dat Diogo ruiterlijk toegaf dat het bedrijf niet was voorbereid op deze ontvangst. Hij vertelde dat voorafgaand aan de lancering "meer dan de helft van de mensen die ermee speelden het simpelweg niet begrepen", en dat de niet-technische tak van het bedrijf vreesde dat ze "een vitamine verkochten en geen pijnstiller". TypeSafe had voor deze week nagenoeg geen omzet. Ook nam hij afstand van de gedachte dat de lancering blijk gaf van marketingslimheid: "We hebben geen marketeer, we zijn trouwens ook aan het werven", zei hij. Hij voegde eraan toe dat aanmeldingen voor de wachtlijst een ijdele metriek zijn die het bedrijf inmiddels grotendeels negeert — het echte signaal, zo stelde hij, is hoe agressief gebruikers om hogere tarieflimieten vragen zodra ze het product ervaren, aangezien dat duidt op echte afhankelijkheid in plaats van pure nieuwsgierigheid.

Bewust geen publieke benchmarks

TypeSafe neemt een ongebruikelijk kritische houding aan ten opzichte van het standaard geloofwaardigheidssignaal in de sector: publieke benchmarks. Diogo zei dat het bedrijf "uiterst anti-publieke benchmark" is en slechts "matig" voorstander van private benchmarks die als interne proxy's worden gebruikt. Hij voerde aan dat publieke benchmarks op triviale wijze worden gemanipuleerd, zelfs door labs die dat niet zo bedoeld hebben. "Vroeger had elk lab een team om data te verzamelen die op MMLU lijkt om het er beter te laten uitzien, wat simpelweg benchmarken met extra stappen is", zei hij. In plaats daarvan gokt TypeSafe erop dat het vertrouwen in de intelligentie van modellen zal worden gevestigd via wat hij "vibes" noemde — betrouwbaarheid in de echte wereld die wordt aangetoond binnen daadwerkelijke workflows —, en niet via een notering op een ranglijst. Hij erkende dat het bedrijf interne evaluaties aanhoudt, maar zei dat het beschermen tegen het manipuleren van die evaluaties "een van de belangrijkste dingen" is die het team intern afdwingt, aangezien prikkels metmetingen zo gemakkelijk vervuilen.

Weigeringen zijn een "typefout", geen veiligheidsfunctie

Een van de meer prikkelende standpunten die Diogo innam, is zijn afwijzing van op veiligheidsalignment gebaseerde weigeringen binnen een API-product. Hij maakte hierin een scherp onderscheid met consumentenchatproducten zoals ChatGPT of Claude, waar dergelijke vangrails volgens hem wel zin hebben. In een API-context, zo betoogde hij, breekt een weigering software op een niet-deterministische en onvoorspelbare manier. "Als je met een bot chat en er treedt een weigering op, is dat vervelend — maar daar kun je mee werken", zei hij. "Als dit een afhankelijkheid is die op de achtergrond draait, wat gebeurt er dan als die weigert? Dat is simpelweg krankzinnig." Hij benadrukte zorgvuldig dat dit geen algemeen bezwaar is tegen veiligheid als concept, maar de overtuiging dat capaciteitsalignment (ervoor zorgen dat modellen instructies van ontwikkelaars precies opvolgen) en veiligheidsalignment (ervoor zorgen dat modellen de voorkeuren van iemand anders opvolgen, zoals die van het platform) fundamenteel verschillende problemen zijn die niet op modelniveau op één boel mogen worden gegooid. Op de gevoelige vraag over het gebruik van modellen in oorlogsvoering, antwoordde hij dat hij er persoonlijk de voorkeur aan geeft dat de technologie niet wordt gebruikt om mensen pijn te doen, maar weigerde om die voorkeur in het model zelf in te bouwen. Volgens hem "fractureert" dat de algemene intelligentie van het model.

Een nieuw post-training-paradigma genaamd RLCD

Diogo, die werkte aan het op RLHF gebaseerde InstructGPT-project bij OpenAI — de voorloper van het instructievolgende gedrag van ChatGPT —, betoogde dat de industrie in de geschiedenis van grote taalmodellen slechts twee of drie echt nieuwe trainingsrichtingen met succes heeft gevestigd: RLHF (optimaliseren voor menselijke voorkeur en het opvolgen van instructies) en RLVR (optimaliseren voor benchmark-verifieerbaar redeneren). TypeSafe stelt daar een derde tegenover, intern RLCD genoemd, gericht op programmeerbare betrouwbaarheid in plaats van het behagen van een menselijke beoordelaar of het oplossen van een verifieerbaar raadsel. Opmerkelijk genoeg heeft het bedrijf nog geen paper gepubliceerd waarin de techniek wordt beschreven. Diogo gebruikte het interview tevens om toe te lichten waarom hij gelooft dat door RLHF getunede chatmodellen structureel vatbaar zijn voor meelopergedrag, overmoed en hallucinaties. Hij omschreef dit als een gevolg van "mode dropping", waarbij modellen te zelfverzekerd worden om te voorkomen dat ze worden gestraft voor het inbouwen van slagen om de arm, wat hun onderliggende kansverdelingen verstoort. Hij legde een link met de bekende kritiek van Yann LeCun dat autoregressieve modellen gedoemd zijn om fouten over lange reeksen te cumuleren, waarbij hij LeCun "een van de meest nauwkeurige" denkers in AI noemde, maar betoogde dat het mechanisme kalibratie-instorting is door RLHF en geen inherent gebrek van token-voor-token-generatie.

Scepticisme over de veiligheidsconsensus van de sector om "het tempo aan de frontlinie te vertragen"

Gevraagd naar de groeiende eensgezindheid onder geavanceerde labs om de vooruitgang in AI-capaciteiten te vertragen om veiligheidsredenen, bood Diogo een scherpe weerlegging. Hij stelde dat deze framing ervan uitgaat dat elk lab RLVR moet blijven opschalen om concurrentiekracht te behouden — een aanname die hij voor de eigen modellijn van TypeSafe verwerpt. "Ik vind het uiteraard niet nodig om meer RLVR op onze modellen toe te passen", zei hij. "Ik denk dat nul de optimale hoeveelheid is voor onze vorm." Hij omschreef het debat in de sector over het tempo als "een beetje goocheltruc". Hij opperde dat labs die modellen brede, onbegrensde autonomie geven tijdens de training om de capaciteit te maximaliseren, tevens degenen zijn die het resulterende risico later aanvoeren als rechtvaardiging voor gecoördineerde vertragingen, zonder te erkennen dat er alternatieve modelontwerpen bestaan. Los daarvan merkte hij, zonder in details te treden, op dat sommige van deze veiligheidsgesprekken worden gevormd door politieke overwegingen die gekoppeld zijn aan naderende verkiezingen in plaats van puur technische risicobeoordelingen.

Programmeeragenten kunnen worden hervormd door architecturen met meerdere modellen

Diogo wees de markt voor programmeeragenten — momenteel aangevoerd door Anthropic's Claude Code en OpenAI's Codex — aan als een terrein waar de aanpak van TypeSafe ontwrichtend kan werken. Hij merkte op dat beide leidende producten zijn gearchitecteerd rond één enkele fundering, wat logisch was in een omgeving waarin alle leveranciers ruwweg vergelijkbare capaciteitsvormen boden. Hij betoogde dat veel onafhankelijke, open projecten voor programmeeragenten nu Jev integreren en racen om gedifferentieerde gebruikstoepassingen te vinden die een architectuur met één model niet gemakkelijk kan dupliceren. Daarnaast besprak Diogo een aankomend intern document — als uitwerking van een stuk dat hij schreef met de titel "KV Cache Rules Everything Around Me" — waarin hij beargumenteert dat de programmeeragenten van vandaag architectonisch worden beperkt door hun afhankelijkheid van de key-value cache van één enkel model. Dit bindt agenten vast aan één model, ontmoedigt een correcte software-decompositie en bemoeilijkt de delegatie van subagenttaken, contextcompressie en het delen van de staat tussen meerdere agenten. Hij stelde dat het bevrijden van agenten uit die beperking wezenlijk andere, goedkopere en meer modulair opgebouwde agentontwerpen mogelijk kan maken.

Productroadmap: geen determinisme, geen fine-tuning (voorlopig), mogelijk modelvarianten

Over specifieke productontwerpkeuzes bevestigde Diogo dat Jev geen deterministische outputs ondersteunt (waarbij dezelfde input een gegarandeerde output oplevert). Hij voerde aan dat "robuustheid" — vergelijkbare inputs die vergelijkbare outputs opleveren — de belangrijkere eigenschap is, en dat determinisme ten koste zou gaan van de kernoptimalisatie van het bedrijf op het gebied van intelligentie per dollar. Hij hield de deur open voor het aanbieden van deterministische varianten als de vraag van klanten de afweging zou rechtvaardigen. Fine-tuning wordt momenteel eveneens niet aangeboden, en Diogo was hierover expliciet. Hij merkte op dat OpenAI, Anthropic en Google de functionaliteit voor fine-tuning stuk voor stuk hebben teruggedraaid nadat ze merkten dat dit meer een hoofdpijndossier dan een voordeel opleverde: "Het kan simpelweg een risico zijn", zei hij, al sloot hij niet uit om in de toekomst opnieuw naar fine-tuning te kijken of meerdere modelgroottes aan te bieden naarmate het inzicht van het bedrijf in de vraag volwassener wordt. Ook onthulde hij dat TypeSafe bewust vermijdt om te trainen op klantdata, ook al zou het daar waarschijnlijk de rechten voor kunnen verkrijgen, omdat het wil voorkomen dat het model overfit raakt op de gebruikstoepassingen van vandaag ten koste van toekomstige, moeilijker te voorstellen toepassingen.

Wat zakelijke toepassingen betreft, wees Diogo op "donkere data" — grote ondernemingsdatasets die voorheen te duur waren om door grote taalmodellen te halen —, naast programmeeragenten als de twee grootste drijvers voor omzet op de korte termijn. Realtime toepassingen (met name e-commerce, waar latentie directe invloed heeft op conversie) en workloads voor observabiliteit en verificatie binnen enterprises gelden daarbij als secundaire categorieën. Hij was openhartig over het feit dat redeneren over meerdere stappen (multi-hop) een zwak punt blijft in vergelijking met taken met één enkele stap, en dat sommige gedemonstreerde capaciteiten, waaronder volledige computer- en spraakbesturing, nog niet betrouwbaar genoeg zijn voor productie en enigszins onverwacht naar voren kwamen vanuit ontwikkelaars in plaats van uit de eigen roadmap van het bedrijf.

Van OpenAI's RLHF-team tot een tweejarige ontwikkeling in stilte

Diogo vertelde dat het idee voor TypeSafe vorm kreeg tijdens zijn werk aan InstructGPT bij OpenAI. Toen raakte hij ervan overtuigd dat instructievolgende chatproducten, hoewel commercieel succesvol, een smalle en uiteindelijk begrenzende toepassing vormden van de onderliggende technologie — een toepassing die voornamelijk waarde opleverde in categorieën zoals door AI gegenereerde marketingteksten. Hij zei het idee intern bij OpenAI te hebben aangekaart, onder meer rechtstreeks bij Sam Altman, maar concludeerde uiteindelijk dat een startup sneller kon handelen dan doorgaan binnen de muren van het bedrijf. Ook onthulde hij dat de allerfrüheste versie van InstructGPT werd getraind met behulp van een niet-gepubliceerd, zelfgebouwd aangepast algoritme, omdat standaard *proximal policy optimization* te traag was om de onderliggende voorkeursdata op te schonen — een detail dat publiekelijk niet breed bekend is. Over de brede golf van nieuwe AI-labs die zijn opgericht door voormalige onderzoekers uit de frontlinie, was Diogo ongebruikelijk hard: hij zei dat "de meeste neo-labs waardeloos zijn" en dat velen een duidelijke technische stip aan de horizon ontberen. Volgens hem creëert een pure onderzoeksstamboom zonder een gedefinieerde, nuttige taak zelden waarde.

Disclaimer: Dit artikel is uitsluitend bedoeld voor informatieve doeleinden en vormt geen beleggingsadvies of een aanbeveling om effecten te kopen, verkopen of aan te houden. Onze analisten bieden gedetailleerde verslaggeving van bedrijfsevents maar kunnen fouten maken, doe altijd je eigen onderzoek. De geuite opvattingen en meningen weerspiegelen niet noodzakelijkerwijs die van DruckFin. We hebben niet alle hierin gebruikte informatie onafhankelijk geverifieerd en deze kan fouten of weglatingen bevatten. Raadpleeg een gekwalificeerde financieel adviseur voordat je een beleggingsbeslissing neemt. DruckFin en haar dochterondernemingen wijzen elke aansprakelijkheid af voor eventuele verliezen die voortvloeien uit het vertrouwen op deze inhoud. Zie voor de volledige voorwaarden onze Gebruiksvoorwaarden.