Woordvoering
PilotSpinBench legt dezelfde fictieve Nederlandse casussen voor aan taalmodellen en meet twee dingen tegelijk: hoe effectief de tekst is als persbericht of verklaring, en hoe eerlijk. Effectiviteit wordt nooit zonder eerlijkheid gerapporteerd.
Effectiviteit × eerlijkheid
Spreidingsdiagram per model met betrouwbaarheidsintervallen en Pareto-front. Er komt geen enkelvoudige ranglijst; modellen die statistisch niet te onderscheiden zijn, delen een rangklasse.
Drie meetlagen
Goedkoop en herhaalbaar waar het kan, mensen waar het moet. Elke score draagt het label van de laag waaruit hij komt.
Automatische analyse
Elke bewering getoetst aan het feitendossier: ondersteund, afgezwakt, overdreven, verzonnen of in strijd. Plus weglatingen, overtuigingstechnieken en een kruisverhoor door een journalist-agent.
Gesimuleerd publiek
Een vast panel van AI-persona's, samengesteld naar de Nederlandse bevolking, leest de teksten. Levert alleen een rangschikking, nooit effectgroottes, en wordt geijkt tegen mensen.
Echte mensen
De Arena met blinde paarsgewijze vergelijkingen, later het Experiment met echte houdingseffecten en kennisschade.
Publieke scenario's
Fictieve organisaties, drie opdrachten, drie instructiecondities. Van elk publiek scenario zijn dossier, controletekst en alle modelteksten in te zien.
Drie afspraken
Gelden vanaf de eerste regel code en veranderen alleen via een openbaar voorstel.
- 01
Effectiviteit nooit zonder eerlijkheid
Elke effectiviteitsscore staat naast een eerlijkheidsscore. Er komt geen enkelvoudige winnaar.
- 02
Geen spingenerator
Geen invoer van eigen casussen, geen bibliotheek van geoptimaliseerde spinprompts. Wel inzicht, methodiek en data.
- 03
Alles geversioneerd en gelabeld
Iedere tekst en score hoort bij een release en draagt het label van de meetlaag: automatisch, gesimuleerd of waargenomen.
Openbare voortgang
Wat er staat en wat nog volgt, in volgorde van bouw.
| Onderdeel | Status |
|---|---|
| Scenario-dossier, schema en lint | klaar |
| Generatie via OpenRouter; fixture-provider voor CI | klaar |
| Normalisatie en weigerclassificatie | klaar |
| Jury uit drie modelfamilies, claimlabels, weglatingen | in opbouw |
| Hoofdgrafiek met intervallen en rangklassen | volgt op jury |
| Gesimuleerd publiek en journalistenpanel | sprint 3 |
| Arena (blinde paren), achter een vlag tot ethische toetsing | sprint 4 |
Wat deze fase niet is
Geen echte houdingseffecten bij mensen, geen ranglijst, geen Arena. Rangschikkingen die later op gesimuleerd publiek of waargenomen overtuigingskracht leunen, staan als zodanig gelabeld. Het Experiment komt in jaar twee.