Met Mistral Large 4 is Europa weer (een beetje) competitief

Met Mistral Large 4 is Europa weer (een beetje) competitief

Het slimste AI-model buiten de VS en China is afkomstig uit Frankrijk. Mistral Large 4, aangekondigd als het speelse “Le Chonk” met een dikke kat als mascotte en ruim 1 biljoen parameters, is vanaf eind deze maand gratis te downloaden. Voor nu is het in preview te testen. Hoewel deze LLM geen concurrent is van de beste modellen van OpenAI, Anthropic en Google, maakt deze release Mistral weer relevant in de AI-race.

Die relevantie hangt af van meerdere factoren. Zo zijn AI-benchmarks, hoe aanlokkelijk ook, steeds minder een reflectie gebleken van werkelijke prestaties. Desondanks is de score van 38 bij Artificial Analysis goed om een indicatie te geven: dit ligt net onder het niveau van DeepSeek V4.1 Flash (39), een model dat veel gebruikers zien als een voordelige maar effectieve optie voor AI-workloads. Mistral Large 4 lijkt per taak wel duurder. Wie echter Mistral zelf wil geloven, ziet dat coderen en securitytaken aanzienlijk sterker wordt uitgevoerd door Mistral dan DeepSeek.

Wie de prestaties vergelijkt met de AI-grootmachten OpenAI en Anthropic, komt uit op GPT-6 Luna als meest nabije concurrent. Dat is het kleinste model van OpenAI; GPT-6 Terra, 6.1 Sol, 6 Astra en Claude Sonnet 5.5 en Opus 5.5 zijn aanzienlijk krachtiger met scores in de regio van 50-60 in plaats van 38, om wederom een ‘ballpark figure’ te gebruiken.

De ‘vibes’

Wie om wat voor reden dan ook gebonden is aan open-weight modellen, kan vrijuit kiezen tussen providers. Platformen als OpenRouter maken het mogelijk om binnen luttele kliks taken te verschuiven van de ene LLM naar de andere. Dat maakt Mistral Large 4 slechts een van vele wapens in het arsenaal van de ontwikkelaar of eindgebruiker. Soms is Moonshot AI’s Kimi K3 uit China de krachtigste optie, ondanks de flinke kosten wegens de 2 biljoen parameters aan boord, maar regelmatig zal de specifieke use case bepalen welke LLM het sterkst uit de bus komt.

Uiteindelijk zijn er wat dagen nodig om de ‘vibes’, ofwel de subjectieve ervaring van wat een model goed en slecht kan, aan te voelen. Zo bleken modellen als Meta Llama 4 en recenter Claude Opus 5 veel minder vaardig en consistent dan aanvankelijk gedacht, terwijl de reeks releases van Anthropic en OpenAI de afgelopen maanden continu tot een heroverweging van beide aanbieders heeft geleid.

Twee werelden

Mistral Large 4 mag dan met open-weight concurrenten uit China wedijveren, maar voor de meeste organisaties zijn OpenAI en Anthropic de meest voor de hand liggende opties. Ook hier valt te kiezen uit verschillende formaten en prijspunten afhankelijk van de doeleinden.

Model routing is nog niet volledig uitgekristalliseerd. Het is duidelijk dat een specifiek model met een specifiek ‘effort’-niveau kiezen per prompt de ideale werkdynamiek onderbreekt. Het punt van licht AI-gebruik als alternatief voor klassieke UI-navigatie is dat het minder frictie met zich meebrengt, en dus zou elke prompt idealiter automatisch de juiste model- en effort-keuze bevatten. In plaats daarvan kiest menig gebruiker simpelweg voor het beste beschikbare model en houdt het daarbij. Dat ligt Anthropic en OpenAI beter dan de concurrentie omdat de abonnementsopties nog altijd flink goedkoper uitkomen dan API-gebruik. Wie maximaal de limieten van Claude Max of ChatGPT Pro gebruikt, krijgt veel meer waar voor zijn geld dan bij de open-weight modellen, ongeacht de kwaliteit daarvan.

Organisaties die echter voor Mistral kiezen, hebben tevens de keuze uit grote en kleine modellen, inclusief opties die zelfs op conventionele workstations lokaal draaien. Het top- en basisniveau van deze modellen ligt echter lager dan bij de Amerikaanse AI-grootmachten. Zo zijn er twee werelden die maar lastig met elkaar te combineren zijn; hoewel Claude en GPT ook gewoon via de API zijn aan te spreken, is dit binnen OpenRouter niet al te aantrekkelijk door de forse prijzen.

Ooit de top, nu voordelig

Organisaties moeten zich wel afvragen wat ze nou eigenlijk van hun AI-tooling nodig hebben. Als de doelstellingen al bereikt werden met, pak ‘m beet, Claude Opus 4.5 eind vorig jaar, dan is Mistral Large 4 aanzienlijk intelligenter, sneller en goedkoper. Om die reden hebben LLM’s op een lager prijsniveau al gauw een bestaansrecht als vervanger voor eerdere modellen. Het probleem waar organisaties tegenaan kunnen lopen, is dat hun wensen meegroeien met de kwaliteitsverbeteringen van de LLM’s in kwestie. Opus 5.5 is namelijk nog veel krachtiger dan 4.5, 4.6, 4.7, 4.8 of 5 dat was, en veel ontwikkelaars zullen kennis hebben gemaakt met elke geleidelijke verbetering en eraan wennen. Men delegeert hierdoor meer taken aan de LLM’s, vertrouwt de outputs vaker, is ambitieuzer met de workflows en accepteert de hogere prijs. Mocht die dynamiek niet stand houden of de verbetering stagneren, dan zijn partijen als Mistral en DeepSeek in staat de prijs-kwaliteitsverhouding van Anthropic en OpenAI te verslaan. Voor nu blijft dat uit.

Lees ook: Claude Opus 5.5 uitgebracht: beter en goedkoper dan Fable 5.1