PrudentBench v1.0 · bijgewerkt 6 september 2026

Welk AI-model is geschikt voor Nederlands juridisch onderzoek?

PrudentBench voert de externe benchmarks niet zelf uit. Wij vatten publieke resultaten samen, voegen één eigen screening op Nederlandse casussen toe en toetsen elk model op compliance.

Claude Opus 5, Claude Fable 5.1 en Muse Spark 1.3 (Max) scoren per september 2026 gelijk het hoogst op de Vals AI Legal Research Bench: 55,29 procent all-pass [1]. Na de compliancetoets, verwerking in de EU, een Europese contractspartij en geen training op klantdata, blijven 6 van de 10 beoordeelde modellen over; Claude Fable 5.1 en Muse Spark vallen af, waardoor Claude Opus 5 het hoogst scorende model is dat de poort haalt. LEO draait daarom diepe analyses op Claude Opus 5 en snelle vragen op Gemini 3.8 Flash, beide via EU-endpoints.

Hoogste score juridisch onderzoek
55,29 %Hoogste score juridisch onderzoekVals AI, peildatum 5 september 2026 [1]
Modellen door de compliancepoort
6 van 10Modellen door de compliancepoortPrudentBench v1.0
Hoofdmodellen bij LEO: diep en snel
2Hoofdmodellen bij LEO: diep en snelProductiestand 6 september 2026
Beoordeelde modellen
10Beoordeelde modellenPrudentBench v1.0

Beau Jonkhout, Technisch directeur PrudAI · Laatst bijgewerkt 6 september 2026 · PrudentBench v1.0

1. De scorekaart

Tien modellen, twee benchmarks en één compliancepoort. Alleen modellen die de poort halen krijgen een PrudentScore.

Voldoet aan de compliancepoortValt af op de compliancepoortIn gebruik bij LEO
Juridisch onderzoek: all-pass in procentenVals AI Legal Research Bench, all-pass, peildatum 5 september 2026 [1]. Gestreepte balken vallen af op de compliancepoort.

Resultaten op de Vals AI Legal Research Bench, hoog naar laag: Claude Opus 5: 55,29%, Voldoet aan de compliancepoort. Claude Fable 5.1: 55,29%, Valt af op de compliancepoort. Muse Spark 1.3 (Max): 55,29%, Valt af op de compliancepoort. GPT-5.6 Sol: 48,08%, Voldoet aan de compliancepoort. Grok 4.6: 48,08%, Valt af op de compliancepoort. Kimi K3: 44,23%, Voldoet aan de compliancepoort. Claude Sonnet 5: 41,83%, Voldoet aan de compliancepoort. GPT-6 Astra: 39,42%, Valt af op de compliancepoort. Gemini 3.8 Flash: 38,94%, Voldoet aan de compliancepoort. Mistral Medium 3.5: 9,14%, Voldoet aan de compliancepoort.

Kwaliteit tegen kosten per taakKosten per voltooide taak in dollars, logaritmisch, tegen all-pass op juridisch onderzoek [1]. Linksboven is goedkoop en goed.

Kosten per voltooide taak tegenover de score op juridisch onderzoek: Claude Opus 5: $6,76, 55,29%, Voldoet aan de compliancepoort. Kimi K3: $3,22, 44,23%, Voldoet aan de compliancepoort. Gemini 3.8 Flash: $1,63, 38,94%, Voldoet aan de compliancepoort. Claude Sonnet 5: $4,08, 41,83%, Voldoet aan de compliancepoort. GPT-5.6 Sol: $21,61, 48,08%, Voldoet aan de compliancepoort. Mistral Medium 3.5: $1,31, 9,14%, Voldoet aan de compliancepoort. Claude Fable 5.1: $23,06, 55,29%, Valt af op de compliancepoort. Muse Spark 1.3 (Max): $0,59, 55,29%, Valt af op de compliancepoort. Grok 4.6: $1,53, 48,08%, Valt af op de compliancepoort. GPT-6 Astra: $10,58, 39,42%, Valt af op de compliancepoort.

Voldoet aan de compliancepoortValt af op de compliancepoort

PrudentScore v1.0

Alleen modellen die de poort halen krijgen een score, op een schaal van 0 tot 100.

  1. 1
  2. 2
    Kimi K370punten
  3. 3
  4. 4
  5. 5
    GPT-5.6 Sol59punten
  6. 6
Alle cijfers als tabel
Scorekaart PrudentBench v1.0: tien AI-modellen op juridisch onderzoek, juridische agenttaken, kosten per taak en de compliancepoort.
ModelAanbieder en routeJuridisch onderzoekJuridische agenttakenKosten per taakStatus bij PrudAICompliancepoortPrudentScore
Claude Opus 5Anthropic via Google Cloud Vertex AI (EU-regio's)55,29%6,67%$6,76In gebruik · diepVoldoet75
Kimi K3Moonshot AI (open weights), via een Europese open-weights-aanbieder44,23%10,83%$3,22Getest, niet in gebruikVoldoet70
Gemini 3.8 FlashGoogle via Vertex AI (EU-regio's)38,94%10,00%$1,63In gebruik · snelVoldoet68
Claude Sonnet 5Anthropic via Google Cloud Vertex AI (EU-regio's)41,83%5,00%$4,08In gebruik · terugvalVoldoet62
GPT-5.6 SolOpenAI via Microsoft Azure OpenAI (Sweden Central)48,08%2,50%$21,61Azure-route, niet in ketenVoldoet59
Mistral Medium 3.5Mistral AI (Parijs), ook via Azure EU Data Zone9,14%0,42%$1,31Niet in gebruikVoldoet28
Claude Fable 5.1Verplichte bewaartermijn van 30 dagen zonder zero data retention, en op Vertex AI is data-sharing met de modelmaker vereist.Anthropic, via Google Cloud55,29%6,67%$23,06Niet inzetbaarValt afgeen score
Muse Spark 1.3 (Max)Alleen via Meta's eigen API; geen route via een hyperscaler en geen gepubliceerde EU-verwerkingsgarantie of EU-contractspartij. De goedkope contributor-tier traint op klantverkeer.Meta55,29%zonder Max: 40,8723,75%$0,59Niet inzetbaarValt afgeen score
Grok 4.6Op Azure alleen beschikbaar als Global Standard, zonder EU Data Zone [22][23].xAI via Microsoft Azure48,08%15,83%$1,53Getest, niet inzetbaarValt afgeen score
GPT-6 AstraOp Azure alleen Global Standard en US Data Zone; geen EU Data Zone [23].OpenAI via Microsoft Azure39,42%5,42%$10,58Niet inzetbaarValt afgeen score

Juridisch onderzoek: Vals AI Legal Research Bench, all-pass in procenten [1]. Juridische agenttaken: Harvey LAB in de uitvoering van Vals, all-pass in procenten [2]. Kosten per taak: Vals AI, in Amerikaanse dollars [1]. Waar een benchmark een effortstand publiceert, staat die in de modelnaam: Muse Spark 1.3 (Max) is een andere stand dan de gewone Muse Spark 1.3, die op 40,87 procent uitkomt.

Benchmarkcijfers: Vals AI Legal Research Bench [1] en de Vals-uitvoering van Harvey LAB [2], beide met peildatum 5 september 2026, geraadpleegd 6 september 2026. De PrudentScore is een samenstelling door PrudAI B.V. en geen cijfer van de benchmarkuitvoerders.

2. Waarom wel, waarom niet: per model

Per model wat het goed doet, waar het op vastloopt en waarvoor wij het geschikt vinden. De losse regel over de Intelligence Index staat er met bron bij, omdat die uit een andere meting komt dan de tabel hierboven.

Claude Opus 5

Anthropic via Google Cloud Vertex AI (EU-regio's)

In gebruik · diepVoldoetPrudentScore 75
  • Gedeeld hoogste score juridisch onderzoek: 55,29 procent all-pass [1].
  • In onze screening het meest bestendig in lange gesprekken met veel bronnen.
  • Het duurste model dat wij inzetten, per token gemeten.
  • Laag op juridische agenttaken: 6,67 procent all-pass [2].

Geschikt voor: Diepe dossieranalyse, jurisprudentieonderzoek en memo's waarin veel bronnen samenkomen.

Artificial Analysis Intelligence Index v4.2: 54,1 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Gedeeld hoogste resultaat op de Vals AI Legal Research Bench: 55,29 procent all-pass, in een gelijkspel met Claude Fable 5.1 en Muse Spark 1.3 (Max), peildatum 5 september 2026 [1].
  • In onze eigen screening het meest bestendige model in lange gesprekken waarin veel bronnen worden aangeroepen.
  • Korting op herhaalde context maakt dossierbreed werk per eenheid werk betaalbaar.

Zwak

  • Het duurste model dat wij inzetten, per token gemeten.
  • Een diepe analyse duurt merkbaar langer dan een snelle vraag.
  • Op juridische agenttaken blijft het model achter: 6,67 procent all-pass op de Vals-uitvoering van Harvey LAB [2].

Kimi K3

Moonshot AI (open weights), via een Europese open-weights-aanbieder

Getest, niet in gebruikVoldoetPrudentScore 70
  • Open weights, dus draaibaar op Europese infrastructuur zonder de modelmaker in het datapad.
  • 44,23 procent all-pass, boven onze modellen voor snelle vragen [1].
  • In onze productietest te traag en te wisselvallig voor interactief gebruik.
  • Geen korting op herhaalde context, dus per eenheid werk duurder.

Geschikt voor: Werk dat volledig op eigen of Europese infrastructuur moet draaien, niet voor de interactieve lagen.

Artificial Analysis Intelligence Index v4.2: 50,2 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Open weights, dus draaibaar op Europese infrastructuur zonder de modelmaker in het datapad.
  • 44,23 procent all-pass op de Vals AI Legal Research Bench, hoger dan de modellen die wij nu voor snelle vragen inzetten [1].
  • Lage kosten per taak in de Vals-meting: 3,22 dollar, bij 10,83 procent all-pass op juridische agenttaken [1][2].

Zwak

  • In onze productietest van augustus 2026 te traag en te wisselvallig voor interactief gebruik.
  • De aanbieder gaf geen korting op herhaalde context, waardoor het model per eenheid werk duurder uitviel dan Claude Opus 5 ondanks een lagere lijstprijs.
  • Sinds augustus 2026 niet meer in onze keten.

Gemini 3.8 Flash

Google via Vertex AI (EU-regio's)

In gebruik · snelVoldoetPrudentScore 68
  • Goedkoopst per eenheid werk van onze modellen: 1,63 dollar per taak [1].
  • Sterkst van onze modellen op juridische agenttaken: 10,00 procent all-pass [2][20].
  • Laagste score juridisch onderzoek van onze modellen: 38,94 procent [1].
  • Roept minder bronnen aan dan Claude Sonnet 5 bij dezelfde vraag.

Geschikt voor: Korte vragen, samenvattingen en eerste verkenningen waarbij het antwoord daarna wordt gecontroleerd.

Artificial Analysis Intelligence Index v4.2: 47,1 op de stand high. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Het goedkoopst per eenheid werk van de modellen die wij inzetten: 1,63 dollar per taak in de Vals-meting [1].
  • In onze eigen screening geen aantoonbaar kwaliteitsverschil met Claude Sonnet 5 op snelle vragen, waardoor de prijs de doorslag geeft.
  • Het sterkst van de modellen die wij inzetten op juridische agenttaken: 10,00 procent all-pass op de Vals-uitvoering van Harvey LAB [2][20].

Zwak

  • Laagste score op juridisch onderzoek van de modellen die wij inzetten: 38,94 procent all-pass [1].
  • Wacht merkbaar langer voor het eerste teken zodra er bronnen worden aangeroepen.
  • Roept minder bronnen aan dan Claude Sonnet 5 bij dezelfde vraag.

Claude Sonnet 5

Anthropic via Google Cloud Vertex AI (EU-regio's)

In gebruik · terugvalVoldoetPrudentScore 62
  • Begint vrijwel direct met antwoorden, geschikt voor doorvragen in een gesprek.
  • 41,83 procent all-pass op juridisch onderzoek, boven Gemini 3.8 Flash [1].
  • Duurder per taak dan Gemini 3.8 Flash: 4,08 tegen 1,63 dollar [1].
  • Laag op juridische agenttaken: 5,00 procent all-pass [2].

Geschikt voor: Terugval achter Gemini 3.8 Flash en achter Claude Opus 5, en werk waarbij snelheid en bronaanroepen samen moeten gaan.

Artificial Analysis Intelligence Index v4.2: 45,1 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Begint vrijwel direct met antwoorden, wat het geschikt maakt voor gesprekken waarin doorgevraagd wordt.
  • Werkt goed samen met bronaanroepen en houdt de draad vast over meerdere stappen.
  • 41,83 procent all-pass op de Vals AI Legal Research Bench, boven Gemini 3.8 Flash [1].

Zwak

  • Per voltooide taak duidelijk duurder dan Gemini 3.8 Flash: 4,08 tegen 1,63 dollar in de Vals-meting [1].
  • Duidelijk lager op juridisch onderzoek dan Claude Opus 5.
  • Laag op juridische agenttaken: 5,00 procent all-pass op de Vals-uitvoering van Harvey LAB, de helft van Gemini 3.8 Flash [2].

GPT-5.6 Sol

OpenAI via Microsoft Azure OpenAI (Sweden Central)

Azure-route, niet in ketenVoldoetPrudentScore 59
  • 48,08 procent all-pass, het hoogste resultaat buiten de Claude-familie [1].
  • Azure EU Data Zone met Microsoft Ireland als contractspartij [23].
  • 21,61 dollar per taak, na Claude Fable 5.1 het duurst in deze lijst [1].
  • Laagst van alle beoordeelde modellen op juridische agenttaken: 2,50 procent [2].

Geschikt voor: Onafhankelijk jurymodel in onze eigen screenings, als derde modelfamilie naast Claude en Gemini. Het model staat niet in de chat-keten van LEO: de terugval daar is GPT-5.4 via dezelfde Azure-route.

Artificial Analysis Intelligence Index v4.2: 51,3 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • 48,08 procent all-pass op de Vals AI Legal Research Bench, het hoogste resultaat buiten de Claude-familie [1].
  • Verwerking in de Azure EU Data Zone met Microsoft Ireland als contractspartij: gpt-5.6-sol staat met naam in de Europa-tabel van Microsoft [23].
  • Een derde modelfamilie naast Claude en Gemini, wat het bruikbaar maakt als onafhankelijk jurymodel.

Zwak

  • 21,61 dollar per taak in de Vals-meting, na Claude Fable 5.1 het duurste model in deze lijst [1].
  • Hoge wachttijd tot het eerste zichtbare teken.
  • Het laagst van alle beoordeelde modellen op juridische agenttaken: 2,50 procent all-pass op de Vals-uitvoering van Harvey LAB [2].

Mistral Medium 3.5

Mistral AI (Parijs), ook via Azure EU Data Zone

Niet in gebruikVoldoetPrudentScore 28
  • De enige Europese modelaanbieder in deze lijst, met Europese contractspartij.
  • Open weights, dus geschikt voor volledig eigen hosting.
  • 9,14 procent all-pass op juridisch onderzoek, het laagst in deze lijst [1].
  • Geen eigen meting van de Intelligence Index, dus drie van vier componenten.

Geschikt voor: Kandidaat voor volledig eigen hosting en voor afgebakende taken, niet voor de chatlagen van LEO.

Artificial Analysis Intelligence Index v4.2: door Artificial Analysis geschat op 22,7, geen eigen meting. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • De enige Europese modelaanbieder in deze lijst, met een Europese contractspartij.
  • Open weights, dus geschikt voor volledig eigen hosting.
  • Via de Azure EU Data Zone inzetbaar binnen dezelfde verwerkersafspraken die wij al hebben; mistral-medium-3-5 staat met naam in de Europa-tabel van Microsoft [23], en Mistral biedt zelf een Europees endpoint [32][33].

Zwak

  • 9,14 procent all-pass op de Vals AI Legal Research Bench, veruit het laagste resultaat in deze lijst [1].
  • 0,42 procent all-pass op juridische agenttaken, eveneens het laagste van de tien [2].
  • Artificial Analysis geeft voor dit model geen eigen meting van de Intelligence Index, alleen een schatting; die telt daarom niet mee, waardoor de PrudentScore hier op drie van de vier componenten rust.

Claude Fable 5.1

Anthropic, via Google Cloud

Niet inzetbaarValt af

Poort dicht: Verplichte bewaartermijn van 30 dagen zonder zero data retention, en op Vertex AI is data-sharing met de modelmaker vereist.

  • Gedeeld hoogste score juridisch onderzoek: 55,29 procent all-pass [1].
  • Zelfde modelfamilie als Claude Opus 5, dus prompts zijn overdraagbaar.
  • 23,06 dollar per taak, ruim drie keer Claude Opus 5 [1].
  • Verplichte bewaartermijn van 30 dagen, geen zero data retention [13][16].

Geschikt voor: Voor ons niet inzetbaar: de compliancepoort gaat dicht op de bewaartermijn en op de vereiste data-sharing.

Artificial Analysis Intelligence Index v4.2: 56,8 op de stand max with fallback, de hoogste van deze tien. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Gedeeld hoogste resultaat op de Vals AI Legal Research Bench: 55,29 procent all-pass, gelijk aan Claude Opus 5 en Muse Spark 1.3 (Max) [1].
  • Zelfde resultaat op juridische agenttaken als Claude Opus 5: 6,67 procent all-pass [2].
  • Zelfde modelfamilie als Claude Opus 5, dus prompts en werkwijze zijn overdraagbaar.

Zwak

  • 23,06 dollar per taak in de Vals-meting, ruim drie keer zoveel als Claude Opus 5 bij dezelfde score [1].
  • De aanbieder merkt het model sinds 31 augustus 2026 aan als Covered Model, met een verplichte bewaartermijn van 30 dagen en zonder zero data retention [13][14][16].
  • Op Google Cloud vereist de Fable-lijn dat data-sharing met de modelmaker wordt aangezet voor misbruikmonitoring [17].

Muse Spark 1.3 (Max)

Meta

Niet inzetbaarValt af

Poort dicht: Alleen via Meta's eigen API; geen route via een hyperscaler en geen gepubliceerde EU-verwerkingsgarantie of EU-contractspartij. De goedkope contributor-tier traint op klantverkeer.

  • Gedeeld hoogste score op de stand Max: 55,29 procent all-pass [1].
  • Hoogste resultaat op juridische agenttaken in deze lijst: 23,75 procent [2].
  • 55,29 procent geldt alleen voor de stand Max, nog in veiligheidstests [1][28].
  • Alleen via Meta's eigen API, zonder gepubliceerde EU-verwerkingsgarantie [29].

Geschikt voor: Voor ons niet inzetbaar zolang er geen route via een hyperscaler met een Europese contractspartij is, en zolang de topscore aan een preview-effortstand hangt.

Artificial Analysis Intelligence Index v4.2: 53,0 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Gedeeld hoogste resultaat op de Vals AI Legal Research Bench: 55,29 procent all-pass op de stand Max, gelijk aan Claude Opus 5 en Claude Fable 5.1 [1].
  • Hoogste resultaat op juridische agenttaken in deze lijst: 23,75 procent all-pass op de Vals-uitvoering van Harvey LAB [2].
  • Verreweg het goedkoopst per voltooide taak in de Vals-meting: 0,59 dollar [1].

Zwak

  • De 55,29 procent geldt alleen voor de stand Max, die volgens de lanceerpost van de aanbieder nog in veiligheidstests zat; de versie die iedereen kan afnemen scoort 40,87 procent [1][28].
  • Alleen via Meta's eigen API, niet via Azure, Google Cloud of Bedrock, en zonder gepubliceerde EU-verwerkingsgarantie of Europese contractspartij [29].
  • De goedkoopste prijstier, de contributor-tier, wordt gebruikt om de producten van de aanbieder te verbeteren en traint dus mee op klantverkeer [29].

Grok 4.6

xAI via Microsoft Azure

Getest, niet inzetbaarValt af

Poort dicht: Op Azure alleen beschikbaar als Global Standard, zonder EU Data Zone [22][23].

  • 48,08 procent all-pass op juridisch onderzoek, gelijk aan GPT-5.6 Sol [1].
  • Sterk op juridische agenttaken: 15,83 procent all-pass [2][26].
  • Op Azure alleen Global Standard, zonder EU Data Zone [22][23].
  • In onze test bijna een minuut stilte voor het eerste teken.

Geschikt voor: Voor ons niet inzetbaar zolang er geen EU Data Zone is. Wij bekijken het opnieuw zodra die er wel is.

Artificial Analysis Intelligence Index v4.2: 50,6 op de stand high. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • 48,08 procent all-pass op de Vals AI Legal Research Bench, gelijk aan GPT-5.6 Sol [1].
  • Via Azure is Microsoft de verwerker en de contractspartij, niet de modelmaker: prompts en antwoorden zijn niet beschikbaar voor de aanbieders van modellen die Azure verkoopt [21].
  • Sterk op juridische agenttaken: 15,83 procent all-pass op de Vals-uitvoering van Harvey LAB [2][26].

Zwak

  • Op Azure alleen als Global Standard beschikbaar, dus zonder gegarandeerde EU-regio; grok-4.6 ontbreekt in de Europa-tabel van Microsoft [22][23].
  • In onze eigen test bijna een minuut stilte voor het eerste teken, en geen korting op herhaalde context.

GPT-6 Astra

OpenAI via Microsoft Azure

Niet inzetbaarValt af

Poort dicht: Op Azure alleen Global Standard en US Data Zone; geen EU Data Zone [23].

  • Sterk in agentisch werk en in programmeertaken.
  • Hoge algemene intelligentie, hoger dan de modellen die wij inzetten.
  • Laag op juridisch onderzoek: 39,42 procent all-pass [1].
  • Op Azure geen EU Data Zone, alleen Global Standard en US [23].

Geschikt voor: Voor ons niet inzetbaar. Wij heropenen de beoordeling zodra er een EU Data Zone is en de score op juridisch onderzoek op niveau komt.

Artificial Analysis Intelligence Index v4.2: 54,7 op de stand max. Bron: Artificial Analysis (artificialanalysis.ai), geraadpleegd 6 september 2026 [37]. artificialanalysis.ai

Meer over dit model

Sterk

  • Sterk in agentisch werk en in programmeertaken.
  • Hoge algemene intelligentie, hoger dan de modellen die wij nu inzetten.
  • Zodra Azure een EU Data Zone levert, ligt de route naar dit model al klaar.

Zwak

  • Laag op juridisch onderzoek: 39,42 procent all-pass op de Vals AI Legal Research Bench [1].
  • Op Azure alleen Global Standard en een US Data Zone beschikbaar, geen EU Data Zone, waardoor de compliancepoort dicht blijft [23].

3. Compliancematrix

De poort gaat pas open als alle drie de eisen zijn afgedekt: verwerking in de EU, een contractspartij in de EU of EER, en contractueel geen training op klantdata. Waar een leverancier geen publiek cijfer geeft, staat er "zie leverancier" en geen schatting.

Compliancematrix: verwerker, contractspartij, EU-dataverwerking, training op klantdata en retentie per model.
ModelEU-verwerkingEU-contractspartijGeen trainingPoort
Claude Opus 5jajajaVoldoet
Kimi K3jajajaVoldoet
Gemini 3.8 FlashjajajaVoldoet
Claude Sonnet 5jajajaVoldoet
GPT-5.6 SoljajajaVoldoet
Mistral Medium 3.5jajajaVoldoet
Claude Fable 5.1neeja (Google Cloud)jaValt af
Muse Spark 1.3 (Max)neeneedeelsValt af
Grok 4.6neejajaValt af
GPT-6 AstraneejajaValt af

Waarom de poort dichtgaat

  • Claude Fable 5.1 — EU-verwerking: Op Google Cloud alleen met verplichte data-sharing met de modelmaker voor misbruikmonitoring en een verplichte bewaartermijn van 30 dagen bij de leverancier [15][17]
  • Muse Spark 1.3 (Max) — EU-verwerking: Geen gepubliceerde EU-verwerkingsgarantie [29][30]
  • Muse Spark 1.3 (Max) — EU-contractspartij: Meta, geen gepubliceerde EU/EER-entiteit
  • Muse Spark 1.3 (Max) — Geen training: Ja op de contributor-tier; niet op de standaardtier [29]
  • Grok 4.6 — EU-verwerking: Nee, alleen Global Standard, geen EU Data Zone [22][23]
  • GPT-6 Astra — EU-verwerking: Nee, alleen Global Standard en US Data Zone [23]
Verwerker, contractspartij en retentie als tabel
Compliancematrix: verwerker, contractspartij, EU-dataverwerking, training op klantdata en retentie per model.
ModelVerwerkerContractspartijEU-dataverwerkingTraining op klantdataRetentie
Claude Opus 5Google CloudGoogle Cloud EMEA LimitedVertex AI, Europe multi-region [18][19]Nee, contractueel uitgesloten [38]0 (zero data retention) [15][16]
Kimi K3Europese open-weights-aanbiederGevestigd in de EU/EER [39]Open weights, gehost in EU-datacenters [39]Nee, contractueel uitgesloten [39]Zie leverancier
Gemini 3.8 FlashGoogle CloudGoogle Cloud EMEA LimitedVertex AI, Europe multi-region [18][19]Nee, contractueel uitgesloten [38]0 (zero data retention) [15][16]
Claude Sonnet 5Google CloudGoogle Cloud EMEA LimitedVertex AI, Europe multi-region [18][19]Nee, contractueel uitgesloten [38]0 (zero data retention) [15][16]
GPT-5.6 SolMicrosoftMicrosoft Ireland Operations LimitedAzure OpenAI, Sweden Central (EU Data Zone) [23]Nee, contractueel uitgesloten [21]Contractueel zero data retention; misbruikmonitoring met reviewers binnen de EER [21]
Mistral Medium 3.5Mistral AI, of Microsoft bij afname via AzureMistral AI SAS (Parijs), of Microsoft Ireland Operations LimitedEuropees endpoint, of Azure EU Data Zone [23][32][33]Nee, contractueel uitgesloten [21]Zie leverancier
Claude Fable 5.1Google CloudGoogle Cloud EMEA LimitedOp Google Cloud alleen met verplichte data-sharing met de modelmaker voor misbruikmonitoring en een verplichte bewaartermijn van 30 dagen bij de leverancier [15][17]Nee, contractueel uitgesloten [38]30 dagen verplicht, geen zero data retention [13][16]
Muse Spark 1.3 (Max)MetaMeta, geen gepubliceerde EU/EER-entiteitGeen gepubliceerde EU-verwerkingsgarantie [29][30]Ja op de contributor-tier; niet op de standaardtier [29]Zie leverancier
Grok 4.6Microsoft (Models sold by Azure)Microsoft Ireland Operations LimitedNee, alleen Global Standard, geen EU Data Zone [22][23]Nee, contractueel uitgesloten [21]Via Azure geldt de Microsoft-verwerkersovereenkomst [21]
GPT-6 AstraMicrosoftMicrosoft Ireland Operations LimitedNee, alleen Global Standard en US Data Zone [23]Nee, contractueel uitgesloten [21]Misbruikmonitoring met reviewers binnen de EER [21]

Deze matrix beschrijft de route die wij zouden gebruiken, niet elke denkbare route naar hetzelfde model. Een aanbieder claimen wij nooit per modelfamilie: Microsoft noemt gpt-5.6-sol en mistral-medium-3-5 met naam in de Europa-tabel en grok-4.6 juist niet [23]. Onze eigen keten, subverwerkers en verwerkersovereenkomst staan in het trust center.

4. Welk model gebruikt LEO, en waarom

LEO draait diepe analyses op Claude Opus 5 en snelle vragen op Gemini 3.8 Flash, met Claude Sonnet 5 en GPT-5.4 via Microsoft Azure OpenAI (Sweden Central) als terugval, alle via EU-endpoints. Dat is de productiestand van 6 september 2026.

Vraag in LEO

Snelle vraag

Gemini 3.8 Flash

Korte vragen en eerste verkenningen, via dezelfde route en dezelfde contractspartij.

Diepe analyse

Claude Opus 5

Dossieranalyse, jurisprudentieonderzoek en memo's, via Google Cloud Vertex AI in EU-regio's.

Terugval

Claude Sonnet 5 en GPT-5.4 via Microsoft Azure OpenAI (Sweden Central)

Claude Sonnet 5 via Vertex AI in EU-regio's en GPT-5.4 via Microsoft Azure OpenAI in Sweden Central.

Alle routes lopen via EU-endpoints, met een Europese contractspartij, contractueel geen training op klantdata en contractueel afgesproken zero data retention.
Kosten per voltooide taakVals AI, in Amerikaanse dollars per voltooide taak [1]. GPT-5.4, de terugval via Microsoft Azure OpenAI, staat niet in de Vals-meting en dus niet in deze grafiek.

Kosten per voltooide taak van de modellen in de keten van LEO: Gemini 3.8 Flash: $1,63. Claude Sonnet 5: $4,08. Claude Opus 5: $6,76.

De vier bouwstenen achter die keuze

1

Kwaliteit per taak

Per taak het model dat die taak aankan, niet één model voor alles.

2

Kosten relatief, en pas na cache

Kosten per eenheid werk, pas na korting op herhaalde context.

3

EU-verwerking als harde eis

EU-endpoints, Europese contractspartij, contractueel geen training op klantdata.

4

Betrouwbaarheid is architectuur

Citaten worden woord voor woord tegen de opgehaalde brontekst gecontroleerd.

Toelichting bij de vier bouwstenen
Kwaliteit per taak
Niet één model voor alles, maar per taak het model dat die taak aankan. Een samenvatting vraagt iets anders dan een reconstructie van tegenstrijdige autoriteit.
Kosten relatief, en pas na cache
Een lagere lijstprijs zegt niets zolang de aanbieder geen korting geeft op herhaalde context. Wij vergelijken kosten per eenheid werk, niet per token.
EU-verwerking als harde eis
Geen model in de keten zonder verwerking via endpoints in EU-regio’s, een Europese contractspartij en contractueel geen training op klantdata.
Betrouwbaarheid is architectuur
Citaten worden woord voor woord tegen de opgehaalde brontekst gecontroleerd. Die controle staat los van het model, dus een modelwissel verandert er niets aan.

5. Methodologie en PrudentScore

De poort

Een model valt af, ongeacht de score, als een van deze drie niet is afgedekt:

  • geen contractuele verwerking in de EU
  • geen contractspartij in de EU of EER
  • geen contractuele uitsluiting van training op klantdata

PrudentScore v1.0

Alleen modellen die de poort halen krijgen een score. De score telt vier componenten bij elkaar op en wordt afgerond op hele punten:

De weging van de vier componenten

  • 50%Juridisch onderzoek
  • 15%Juridische agenttaken
  • 15%Algemene intelligentie
  • 20%Kostenefficiëntie
De rekensom en de uitkomsten per model
  1. 50 procent juridisch onderzoek: Vals AI Legal Research Bench, all-pass, gedeeld door de hoogste score van 55,29 [1].
  2. 15 procent juridische agenttaken: Harvey LAB in de uitvoering van Vals, all-pass, gedeeld door de hoogste score van 25,42, de hoogste waarde op het Vals-leaderboard (Muse Spark 1.2, dat niet in deze lijst staat) [2].
  3. 15 procent algemene intelligentie: Artificial Analysis Intelligence Index v4.2, gedeeld door de hoogste score van 56,8, dat is Claude Fable 5.1 op 56,76, afgerond [6][37].
  4. 20 procent kostenefficiëntie: 1 min een logaritmische schaal van de kosten per taak, met 0,59 dollar als ondergrens en 23,06 dollar als bovengrens [1].

Ontbreekt een component, dan worden de overige gewichten herschaald over het resterende deel. De uitkomsten hieronder rolt de pagina zelf uit deze formule, afgerond op hele punten; ze staan nergens als getal opgeslagen.

Uitkomsten v1.0, berekend uit deze formule

  • Claude Opus 54 van 4 componenten75
  • Kimi K34 van 4 componenten70
  • Gemini 3.8 Flash4 van 4 componenten68
  • Claude Sonnet 54 van 4 componenten62
  • GPT-5.6 Sol4 van 4 componenten59
  • Mistral Medium 3.53 van 4 componenten28

Wat wij zelf doen

Onze eigen beoordeling loopt in vier stappen. Eerst het compliancefilter: valt een model daar af, dan meten wij het niet verder. Daarna een signaalwacht: wij wachten tot de eerste publieke resultaten stabiel zijn in plaats van op de releasedag te wisselen. Vervolgens een screening op onze productie-instellingen, dus met onze prompts, onze bronaanroepen en onze contextlengte, niet op de benchmark-stand. Pas daarna een volledige benchmark.

Twee dingen wegen daarin zwaar. Compliance is een poort, geen weegfactor: een model dat de poort niet haalt krijgt geen tweede kans op basis van kwaliteit. En de cache-economie is beslissend: een aanbieder zonder korting op herhaalde context is bij dossierbreed werk duurder dan de lijstprijs doet vermoeden.

PrudAI is zelf leverancier van LEO. Daarom citeren we uitsluitend cijfers van partijen die niet van ons zijn, publiceren we de formule, en tonen we ook de modellen die wij níet gebruiken met de reden.

Wat wij niet meten

Een onafhankelijke, gepubliceerde benchmark voor Nederlands juridisch werk bestaat nog niet. Onze eigen Nederlandse meetset (100 uitspraken × 10 vragen) is in opbouw; zodra die de kwaliteitspoort passeert, publiceren we de uitkomsten hier.

Dat gat is te controleren in de literatuur. De enige serieuze Nederlandstalige juridische vraag-en-antwoordbenchmark, bLLeQA, gaat over Belgisch recht en de auteurs schrijven zelf dat betrouwbare bronnen voor het Nederlands schaars zijn [34]. De enige benchmark die Nederlands recht raakt, Multi-Legal-Bench, doet metadata-classificatie en uitkomstpredictie op uitspraken, geen juridisch onderzoek [35]. In de EU-brede kennisbenchmark EU-MMLU zit Nederlands wel, maar het juridische onderdeel daarvan is uitsluitend internationaal recht [36].

Die meetset begon als een screening op 20 Nederlandse casussen met een blinde jury en een controle op ECLI-verwijzingen. Zolang de uitbreiding niet af is publiceren wij er geen cijfers uit.

Harvey LAB bestaat in drie uitvoeringen, door Harvey zelf [4][5], door Vals [2] en door Artificial Analysis [8], met uitkomsten die een factor drie kunnen schelen. Wij citeren consequent de Vals-uitvoering op all-pass, omdat daar alle modellen op dezelfde harness draaien, en noemen Artificial Analysis alleen in lopende tekst met bronvermelding.

De PrudentScore is een samenstelling door PrudAI B.V. op basis van openbaar gepubliceerde cijfers en vertegenwoordigt niet de opvatting of goedkeuring van Vals AI, Harvey of Artificial Analysis. Cijfers van Artificial Analysis staan uitsluitend in lopende tekst, met bronvermelding en link, zoals de voorwaarden van die partij voorschrijven [9].

6. Wat er veranderde

Wijzigingen in deze pagina en in de modellen die LEO gebruikt.

  1. 6 september 2026

    PrudentBench v1.0, eerste publicatie, op basis van de modelherijk van september.

  2. 3 september 2026

    De snelle laag van LEO is overgezet naar Gemini 3.8 Flash.

  3. augustus 2026

    Kimi K3 uit de keten gehaald, vanwege de kosten per eenheid werk en de snelheid.

  4. juli 2026

    Claude Opus 5 in gebruik genomen als model voor diepe analyse, via Vertex AI in EU-regio's.

  5. juli 2026

    Claude Sonnet 5 in gebruik genomen als snelle laag.

7. Veelgestelde vragen

De tien vragen die wij het vaakst krijgen over modelkeuze en juridisch werk.

Wat is het beste AI-model voor juridisch advies?

Op de enige benchmark voor juridisch onderzoek die door juristen wordt beoordeeld, de Vals AI Legal Research Bench, staan Claude Opus 5, Claude Fable 5.1 en Muse Spark 1.3 (Max) gedeeld bovenaan met 55,29 procent all-pass, peildatum 5 september 2026 [1]. Voor een kantoor telt daarnaast de compliancepoort: verwerking in de EU, een Europese contractspartij en geen training op klantdata. Van die drie haalt alleen Claude Opus 5 die poort. Een onafhankelijke, gepubliceerde benchmark voor Nederlands juridisch werk bestaat nog niet.

Is ChatGPT AVG-proof voor advocaten?

Dat hangt niet af van het model, maar van de route en het contract. Een consumentenabonnement biedt geen verwerkersovereenkomst en geen keuze van verwerkingsregio. Via Microsoft Azure OpenAI in Sweden Central is Microsoft Ireland de contractspartij, ligt er een verwerkersovereenkomst en wordt er contractueel niet op klantdata getraind. Dat is de route die wij voor GPT-modellen gebruiken. Beoordeel altijd de eigen situatie en de eigen verwerkersovereenkomst.

Mag ik cliëntgegevens in een AI-model invoeren?

Alleen als de verwerking is afgedekt: een verwerkersovereenkomst met de aanbieder, geen training op de ingevoerde gegevens, een vastgelegde verwerkingsregio en heldere afspraken over bewaartermijnen. Het beroepsgeheim verdwijnt niet omdat er een model tussen zit, de verantwoordelijkheid blijft bij het kantoor. Onze afspraken staan in de verwerkersovereenkomst op legal.prudai.com en de keten staat beschreven in het trust center.

Claude of ChatGPT voor juridisch onderzoek?

Op de Vals AI Legal Research Bench haalt Claude Opus 5 55,29 procent all-pass tegen 48,08 procent voor GPT-5.6 Sol, bij kosten van 6,76 tegen 21,61 dollar per taak, peildatum 5 september 2026 [1]. Beide routes voldoen aan onze compliancepoort. LEO gebruikt Claude Opus 5 voor diepe analyses en houdt GPT via Microsoft Azure achter de hand: GPT-5.4 als terugval in de keten, GPT-5.6 Sol als onafhankelijk jurymodel in onze eigen screenings.

Waarom verzint AI jurisprudentie, en welk model doet dat het minst?

Een taalmodel voorspelt tekst, en een plausibel ogende ECLI is voor het model even waarschijnlijk als een echte. Er is geen publieke meting van hallucinatie op Nederlandse jurisprudentie, voor geen enkel model [34][35], dus wij wijzen geen winnaar aan. De oplossing zit in de architectuur, niet in de modelkeuze: LEO haalt uitspraken bij de bron op en controleert elk citaat woord voor woord tegen de opgehaalde tekst.

Welke modellen verwerken data in de EU?

Van de tien beoordeelde modellen halen er zes de poort: Claude Opus 5 en Claude Sonnet 5 via Google Cloud Vertex AI in EU-regio’s, Gemini 3.8 Flash via dezelfde route, GPT-5.6 Sol via Microsoft Azure OpenAI in Sweden Central, Mistral Medium 3.5 via een Europees endpoint en Kimi K3 via een Europese open-weights-aanbieder. Claude Fable 5.1, Grok 4.6, GPT-6 Astra en Muse Spark vallen af [17][22][23][29].

Traint de aanbieder op mijn dossiers?

Bij de routes die wij gebruiken niet: Google Cloud en Microsoft sluiten training op klantdata contractueel uit, en bij onze modelaanbieders is contractueel zero data retention afgesproken. Let op de uitzonderingen in de markt. Claude Fable 5.1 kent een verplichte bewaartermijn van 30 dagen zonder zero data retention [13][16], en de contributor-tier van Muse Spark wordt gebruikt om de producten van de aanbieder te verbeteren [29].

Wat betekent de AI Act voor mijn kantoor?

Een kantoor dat een AI-systeem inkoopt en gebruikt is doorgaans gebruiksverantwoordelijke, niet aanbieder. De verplichtingen die dan het eerst spelen zijn AI-geletterdheid bij medewerkers, transparantie richting cliënten en menselijk toezicht op de uitkomst. Onze rolverdeling, documentatie en subverwerkers staan in het trust center op trust.prudai.com.

Hoe vaak wordt PrudentBench bijgewerkt?

Elk kwartaal, en tussentijds zodra een grote modelrelease of een wijziging in een verwerkingsroute daar aanleiding toe geeft. Elk cijfer op deze pagina staat met bron en peildatum vermeld. Cijfers ouder dan zes maanden beschouwen wij als verlopen: die verifiëren wij eerst opnieuw bij de bron voordat wij ze opnieuw publiceren.

Meet PrudAI zelf, of vat het alleen samen?

Allebei, en wij houden het uit elkaar. De scores voor juridisch onderzoek en agenttaken komen van Vals AI en Harvey LAB, die benchmarks voeren wij niet zelf uit. Daarnaast draaien wij een eigen screening op Nederlandse casussen, op onze productie-instellingen in plaats van op de benchmark-stand. Die screening is klein en wordt uitgebreid, en wij publiceren er nog geen cijfers uit.

8. Bronnen

De nummers tussen blokhaken in de tekst en in de tabellen verwijzen naar deze lijst. Alle externe bronnen zijn geraadpleegd op 6 september 2026; de benchmarkcijfers hebben peildatum 5 september 2026.

  1. [1]Vals AI. Legal Research Bench. benchmarkpagina, versie 1, bijgewerkt 5 september 2026.https://www.vals.ai/benchmarks/legal_researchGeraadpleegd 6 september 2026
  2. [2]Vals AI. Harvey's Legal Agent Benchmark (HLAB-leaderboard). leaderboard, versie 1, bijgewerkt 5 september 2026.https://www.vals.ai/benchmarks/hlabGeraadpleegd 6 september 2026
  3. [3]Vals AI. Methodology. methodologiepagina, zonder publicatiedatum.https://www.vals.ai/methodologyGeraadpleegd 6 september 2026
  4. [4]Grupen, N., Pereyra, G. & Pereyra, J. (Harvey AI). Open-Sourcing Harvey's Long Horizon Legal Agent Benchmark. Harvey AI, 6 mei 2026.https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmarkGeraadpleegd 6 september 2026
  5. [5]Harvey AI. Harvey LAB: The Legal Agent Benchmark, v1.0. dataset en harness op GitHub, licentie MIT.https://github.com/harveyai/harvey-labsGeraadpleegd 6 september 2026
  6. [6]Artificial Analysis. Announcing Artificial Analysis Intelligence Index v4.2. 4 september 2026.https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2Geraadpleegd 6 september 2026
  7. [7]Artificial Analysis. Artificial Analysis Intelligence Benchmarking Methodology. methodologiepagina, zonder publicatiedatum.https://artificialanalysis.ai/methodology/intelligence-benchmarkingGeraadpleegd 6 september 2026
  8. [8]Artificial Analysis. Announcing Harvey LAB-AA: evaluating AI agents on real-world legal work. 7 juli 2026.https://artificialanalysis.ai/articles/harvey-lab-aaGeraadpleegd 6 september 2026
  9. [9]Artificial Analysis, Inc.. Artificial Analysis Data Platform Terms and Conditions, versie 1.1. herzien 19 augustus 2026.https://artificialanalysiscdn.com/legal/ProDataPlatformTerms.pdfGeraadpleegd 6 september 2026
  10. [10]Anthropic. System Card: Claude Opus 5. 24 juli 2026, 198 pagina’s.https://www.anthropic.com/claude-opus-5-system-cardGeraadpleegd 6 september 2026
  11. [11]Anthropic. System Card: Claude Fable 5.1 & Claude Mythos 5.1. 1 september 2026, 212 pagina’s.https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-cardGeraadpleegd 6 september 2026
  12. [12]Anthropic. System Card: Claude Sonnet 5. 30 juni 2026, 145 pagina’s.https://www.anthropic.com/claude-sonnet-5-system-cardGeraadpleegd 6 september 2026
  13. [13]Anthropic. Data retention practices for Covered Models. Anthropic Privacy Center, alleen een relatieve datum op de pagina.https://privacy.claude.com/en/articles/15425996-data-retention-practices-for-covered-modelsGeraadpleegd 6 september 2026
  14. [14]Anthropic. Covered Models. Anthropic Help Center, alleen een relatieve datum op de pagina.https://support.claude.com/en/articles/15425695-covered-modelsGeraadpleegd 6 september 2026
  15. [15]Anthropic. Data residency. Claude Platform Docs, zonder datum.https://platform.claude.com/docs/en/manage-claude/data-residencyGeraadpleegd 6 september 2026
  16. [16]Anthropic. API and data retention. Claude Platform Docs, zonder datum.https://platform.claude.com/docs/en/manage-claude/api-and-data-retentionGeraadpleegd 6 september 2026
  17. [17]Google Cloud. Abuse monitoring. Gemini Enterprise Agent Platform, bijgewerkt 2 september 2026.https://docs.cloud.google.com/vertex-ai/generative-ai/docs/learn/abuse-monitoringGeraadpleegd 6 september 2026
  18. [18]Google Cloud. Claude Opus 5 on Google Cloud. bijgewerkt 2 september 2026.https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/partner-models/claude/opus-5Geraadpleegd 6 september 2026
  19. [19]Google Cloud. Claude Sonnet 5 on Google Cloud. bijgewerkt 2 september 2026.https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/partner-models/claude/sonnet-5Geraadpleegd 6 september 2026
  20. [20]Google DeepMind. Gemini 3.8 Flash — Model evaluation: Approach, methodology & results. september 2026, 4 pagina’s (PDF).https://storage.googleapis.com/deepmind-media/gemini/gemini_3-8_flash_model_evaluation.pdfGeraadpleegd 6 september 2026
  21. [21]Microsoft. Data, privacy, and security for Foundry Models sold by Azure in Microsoft Foundry. Microsoft Learn, 18 mei 2026.https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/openai/data-privacyGeraadpleegd 6 september 2026
  22. [22]Microsoft. Deploy and use Grok models in Microsoft Foundry. Microsoft Learn, 26 augustus 2026.https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-grokGeraadpleegd 6 september 2026
  23. [23]Microsoft. Region availability for Foundry Models sold by Azure. Microsoft Learn, 3 september 2026.https://learn.microsoft.com/en-us/azure/foundry/foundry-models/concepts/models-sold-directly-by-azure-region-availabilityGeraadpleegd 6 september 2026
  24. [24]OpenAI. GPT-5.6 System Card. 9 juli 2026, herzien 19 augustus 2026, 82 pagina’s (PDF).https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdfGeraadpleegd 6 september 2026
  25. [25]OpenAI. GPT-6 Astra System Card. 3 september 2026, 117 pagina’s (PDF).https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdfGeraadpleegd 6 september 2026
  26. [26]SpaceXAI (DBA xAI LLC). Model Card: Grok 4.6. 12 augustus 2026, revisie 17 augustus 2026, 42 pagina’s (PDF).https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdfGeraadpleegd 6 september 2026
  27. [27]Kimi Team (Moonshot AI). Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3. arXiv:2607.24653v2 [cs.CL], 7 augustus 2026, 47 pagina’s.https://arxiv.org/abs/2607.24653Geraadpleegd 6 september 2026
  28. [28]Meta AI Research. Introducing Muse Spark 1.3. 2 september 2026.https://research.meta.ai/blog/introducing-muse-spark-1-3Geraadpleegd 6 september 2026
  29. [29]Meta. Muse Spark 1.3 (modelpagina). zonder datum.https://developer.meta.com/ai/models/muse-spark/Geraadpleegd 6 september 2026
  30. [30]Meta. Meet Muse Spark 1.2 and Muse Code: a coding model and the agent built to run it. 5 augustus 2026.https://developer.meta.com/ai/resources/blog/build-with-muse-code/Geraadpleegd 6 september 2026
  31. [31]Mistral AI. Mistral Medium 3.5 (model card, versie v26.04). licentie Modified MIT.https://docs.mistral.ai/models/model-cards/mistral-medium-3-5-26-04Geraadpleegd 6 september 2026
  32. [32]Mistral AI. In-region inference, open models, and new European infrastructure for sovereign AI. 11 augustus 2026.https://mistral.ai/news/regional-inference-open-models-new-compute/Geraadpleegd 6 september 2026
  33. [33]Mistral AI. Regional inference. Mistral Docs, zonder datum.https://docs.mistral.ai/inference/regional-inferenceGeraadpleegd 6 september 2026
  34. [34]Banar, N., Lotfi, E., Van Nooten, J., Kliocaite, M. & Daelemans, W.. bLLeQA: Benchmarking LLMs for Grounded Legal Question-Answering in French and Dutch. Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM 2026), ACL, juli 2026, pp. 34–59, DOI 10.18653/v1/2026.knowfm-1.4.https://aclanthology.org/2026.knowfm-1.4/Geraadpleegd 6 september 2026
  35. [35]Ovcharov, V.. Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions. arXiv:2605.29738v2, 7 augustus 2026.https://arxiv.org/abs/2605.29738Geraadpleegd 6 september 2026
  36. [36]Europese Commissie, DG Translation en het EMT-netwerk. EU-MMLU (dataset). 17.203 rijen, 16 taalconfiguraties waaronder NL_NL, licentie CC BY 4.0.https://huggingface.co/datasets/EC-DGT-AI/EU-MMLUGeraadpleegd 6 september 2026
  37. [37]Artificial Analysis. Modelpagina's (Intelligence Index v4.2 per model). doorlopend bijgewerkte modelpagina’s, waarden afgelezen 6 september 2026.https://artificialanalysis.ai/modelsGeraadpleegd 6 september 2026
  38. [38]Google Cloud. Service Specific Terms. Gemini Enterprise Agent Platform / generatieve-AI-diensten: Google gebruikt klantdata niet om modellen te trainen of af te stemmen zonder toestemming.https://cloud.google.com/terms/service-termsGeraadpleegd 6 september 2026
  39. [39]PrudAI B.V.. Privacyverklaring. PrudAI Legal Center, hoofdstuk subverwerkers en verwerkingslocaties.https://legal.prudai.com/privacyGeraadpleegd 6 september 2026

Volledige bronnenlijst

Claude en Anthropic, GPT en OpenAI, Gemini en Google, Grok en xAI, Kimi en Moonshot AI, Muse en Meta, Mistral, Harvey, Vals AI en Artificial Analysis zijn handelsmerken van hun respectieve eigenaren. Vermelding dient uitsluitend ter identificatie en impliceert geen samenwerking, sponsoring of goedkeuring.

De getoonde beeldmerken zijn eigendom van hun respectieve eigenaren en staan hier uitsluitend ter identificatie van de aanbieder of de route. De iconenset komt van Simple Icons (CC0).

Beau Jonkhout, Technisch directeur PrudAI · Laatst bijgewerkt 6 september 2026 · PrudentBench v1.0