Neem twee reviews met hetzelfde oordeel en hetzelfde betrouwbaarheidscijfer. De ene steunt op technisch bewijs, de andere alleen op een korte projectomschrijving. De cijfers lijken vergelijkbaar, maar de onderbouwing is dat niet.
Betrouwbaarheid hoort iets te zeggen over de basis van een oordeel. Bij AI-gegenereerde analyses kan het cijfer ook meebewegen met de stelligheid van de tekst. Aan de uitkomst alleen is dat verschil niet te zien.
Waarom betrouwbaarheid context nodig heeft
Taalmodellen kunnen hun eigen zekerheid onder specifieke omstandigheden redelijk inschatten. Kadavath en collega’s lieten in 2022 zien dat de zekerheid van grote modellen bij meerkeuzevragen en waar-of-niet-waar-vragen redelijk overeenkwam met hun juistheid, mits die vragen in het juiste formaat werden voorgelegd.¹ De vraag 'is dit product klaar om live te gaan?' is veel opener. Er is geen antwoordsleutel, geen vaste schaal en tijdens de analyse blijkt niet vanzelf of het antwoord klopt.
Buiten gesloten vraagvormen is de relatie tussen zekerheid en juistheid lastiger vast te stellen. Een verzorgde analyse op basis van weinig materiaal kan overtuigender klinken dan een voorzichtige analyse met een veel bredere bewijsbasis.
Geen bevinding is niet hetzelfde als geen risico
Altman en Bland maakten het onderscheid in 1995 expliciet: afwezigheid van bewijs is geen bewijs van afwezigheid.² Hun notitie ging over klinisch onderzoek, maar het methodologische punt geldt ook voor productreviews.
Een beoordelaar zonder toegang tot de code kan niet vaststellen of een specifieke injectiefout aanwezig is. Een rapport zonder bevinding op dat punt is daarom onvolledig en niet automatisch schoon.
Een controle zonder bewijs mag niet als geslaagd in een rapport staan. De juiste status is 'niet vastgesteld'. Het systeem moet dat onderscheid bewaken, zodat de lezer het niet zelf hoeft af te leiden.
Vastleggen welk bewijs is beoordeeld
Forenta legt vast welke soorten materiaal beschikbaar waren voor een organisatorische review. Dat kan gaan om de projectomschrijving, besluiten uit eerdere fasen en context uit een bron die de organisatie zelf heeft gekoppeld. Ontbrekend materiaal blijft zichtbaar als ontbrekend.
Dit onderscheid volgt uit het materiaal dat voor de review beschikbaar was en niet uit de mededeling van een model dat het iets heeft bekeken. Een zin over een beoordeelde architectuur is nog geen bewijs dat die architectuur daadwerkelijk beschikbaar was.
Als een oordeel vooral op geschreven context rust, moet de uitkomst dat vermelden en meer onzekerheid tonen dan een review met direct technisch bewijs. De publieke uitleg stopt daar bewust. Exacte interne beslisregels zijn implementatiedetails en geen bewijs van kwaliteit.
Deze lijst volgt uit het materiaal dat voor de review beschikbaar was. De tekst van het model geldt niet als bewijs dat een bron is bekeken.
Vergelijkbare controles tussen reviews
Bevindingen in vrije tekst zijn lastig te volgen over de tijd. “Autorisatie verdient aandacht” van vorige maand en “toegangscontrole is hier en daar dun” van deze maand kunnen hetzelfde probleem zijn of twee verschillende, en aan de woorden zie je het niet.
Vaste controlecodes maken opeenvolgende reviews beter vergelijkbaar. De uitkomst kan onderscheid maken tussen vastgesteld, openstaand en niet van toepassing. Zo is zichtbaar wat veranderde zonder afhankelijk te zijn van ongeveer gelijk klinkende formuleringen.
Een positieve bevinding zonder passend bewijs blijft niet als vastgesteld staan. De oorspronkelijke claim blijft herleidbaar en de reden voor de aangepaste status wordt vastgelegd.
De status 'niet van toepassing' blokkeert niet. 'Gefaald', 'gedeeltelijk' en 'niet vastgesteld' doen dat wel.
Openstaande blokkades bepalen of een project verder kan
Een gemiddelde geeft hier een verkeerd beeld. Negen controles op orde en één ontbrekende sleutelrotatie maken een project niet voor negentig procent klaar. Het project kan nog niet verder totdat dat ene punt is geregeld.
Forenta laat openstaande blokkades daarom zwaarder wegen dan het gemiddelde. Wat niet is vastgesteld, telt niet als goedgekeurd. Een punt dat aantoonbaar niet van toepassing is, blokkeert de voortgang niet.
De uitkomst benoemt de blokkades. Daarmee krijgt het team een concrete vervolgactie in plaats van een percentage zonder eigenaar.
| Manier van lezen | Uitkomst | Wat je ermee kunt |
|---|---|---|
| Gemiddelde van de statussen | 80% klaar | Niets concreets. Het getal heeft geen eigenaar. |
| Begrensd door blokkades | Prototype. Geblokkeerd door één controle. | Die controle vaststellen en opnieuw beoordelen. |
Wat dit niet oplost
Hiermee wordt een oordeel niet automatisch juist. Wel wordt zichtbaar waarop het berust. Ook een review met al het relevante materiaal kan ernaast zitten, terwijl een voorzichtige review op basis van beperkt materiaal achteraf juist kan blijken.
Forge, het publieke analyseproduct, werkt met tekst die de gebruiker indient. Het haalt geen URL op en kloont geen repository. In een gecontroleerde pilot met Forenta for Business kan een organisatie een afgebakende bron met alleen-leestoegang koppelen. De bevindingen blijven AI-gegenereerde analyses en zijn geen directe waarnemingen van een menselijke auditor.
De methode is nog niet gevalideerd op een grote dataset met projectuitkomsten. De betrouwbaarheid moet daarom blijken uit gedocumenteerde praktijksituaties, menselijke controle en duidelijke beperkingen, niet uit de interface alleen.
Een cijfer wordt pas bruikbaar als je weet waar het vandaan komt
Methoden voor gestructureerde raadpleging van deskundigen maakten dit punt al voordat taalmodellen bestonden. Cooke beschrijft hoe je deskundigen toetst aan bekende grootheden en onzekerheid expliciet houdt, in plaats van een schijnbaar eenduidig antwoord af te dwingen.³ Ook de NIST-richtlijn voor generatieve AI benadrukt dat de onderbouwing van een claim moet worden vastgelegd.⁴ Het bredere AI Risk Management Framework behandelt meten als onderdeel van doorlopende risicobeheersing, niet als een zelfstandig eindcijfer.⁵
De praktische versie is kleiner dan de literatuur. Vraag elk systeem dat je een oordeel geeft wat het heeft kunnen inzien. Kan het die vraag niet beantwoorden, dan is het oordeel een zin met een getal erachter.
Wat legt Forenta vast over het beschikbare bewijs?
Per review legt Forenta vast welke soorten bewijs beschikbaar waren en wat ontbrak. Dat overzicht volgt uit het ingediende materiaal, niet uit wat het model zegt te hebben gelezen.
Waarom blokkeert niet vastgesteld even hard als gefaald?
Omdat niet gecontroleerd niet hetzelfde is als goedgekeurd. Als een controle zonder bewijs toch als geslaagd geldt, lijkt het project verder dan aantoonbaar is.
Leest Forenta mijn repository?
Forge leest geen repository en analyseert alleen de tekst die je indient. Binnen een gecontroleerde pilot met Forenta for Business kan een organisatie een afgebakende bron met alleen-leestoegang koppelen. De omgeving toont welk materiaal beschikbaar was.
Bronnen
- 1.Kadavath, S., et al. (2022). Language Models (Mostly) Know What They Know. arXiv:2207.05221.
- 2.Altman, D. G., & Bland, J. M. (1995). Statistics notes: Absence of evidence is not evidence of absence. BMJ, 311, 485.
- 3.Cooke, R. M. (1991). Experts in Uncertainty: Opinion and Subjective Probability in Science. Oxford University Press.
- 4.NIST (2024). Artificial Intelligence Risk Management Framework: Generative AI Profile (NIST AI 600-1).
- 5.NIST (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0).