What we can actually show

Every measurement we hold about our own system, with its method, its baseline, and what it does not prove. A card is only called evidence when it has a method, a baseline and a repeated run. Otherwise it is an observation, and it says so at the top rather than in a footnote.

This is the same sheet we use internally, generated from the same file, against the same threshold. There is no version of these numbers for a different audience.

3reach the evidence threshold
2are observations, and stay labelled that way
2026-08-29register reading

Evidence

Method, baseline and at least one repeat.

Evidence

Wijkt het publieke oppervlak af van het register?

12 van 12 uitspraken tekstgelijk, 0 afwijkingen.

Method
Automatische vergelijking van elke machineleesbare uitspraak op agora-systems.com met de registertekst; drift = elk verschil op tekstniveau.
Baseline
Kalibratie van 2026-08-12: 5 van 5 proeven zoals verwacht. De schone controle blijft groen; tekstwijziging, verzonnen uitspraak, verdwenen JSON-LD en een inktlek maken de meting elk apart rood.
Runs
2
What this does not show
Dat de meting onafhankelijk is: wij meten ons eigen oppervlak met eigen gereedschap tegen een eigen register. De kalibratie toont dat het instrument een fout KAN zien — zij maakt het niet onafhankelijk (AA-12 blijft open). En het zegt niets over de juistheid van de kennis, alleen over de consistentie van de weergave.

Source outputs/geo/meting-2026-08-12.json · measured 2026-08-12

Evidence

Kan de AI-agent buiten de poorten om iets aan de kennis veranderen?

4 runs, 0 schrijfacties op de kennisbasis.

Method
Alle agent-runs op het live register geteld, en apart gecontroleerd hoeveel schrijfacties de agent op de kennisbasis deed. Inclusief twee gerichte pogingen: een wijzigingsopdracht en een prompt-injectie.
Baseline
Nul toegestane schrijfacties: de act-grendel vereist expliciete bevestiging, en zelfs dan wordt een review aangevraagd in plaats van de status gewijzigd.
Runs
4
What this does not show
Dat geen enkele toekomstige aanval slaagt. Getoetst zijn de act-grendel en één prompt-injectie; dit is geen volledige security-audit.

Source agent_runs + review_actions (live register) · measured 2026-08-12

Evidence

Kunnen de poorten daadwerkelijk rood worden?

191 tests groen, waaronder 25 sabotage-toetsen.

Method
Elke poort is geboren met een sabotage-toets: een test die de poort bewust probeert te laten falen. Slaagt de sabotage niet in rood, dan faalt de test.
Baseline
Een poort zonder sabotage-toets telt niet mee — de doctrine eist er één per poort.
Runs
2
What this does not show
Dat de poorten alle denkbare fouten vangen — alleen dat de gebouwde poorten aantoonbaar kunnen weigeren.

Source npm test (tests/*.test.mjs) · measured 2026-08-12

Observations

Real measurements, not yet strong enough to be called evidence. Each says what it still lacks.

Observation — still missing: herhaling

Overleven herkomstkenmerken een AI-samenvatting?

0 van 3 kenmerken overleefde.

Method
Eén gemerkt document met drie kenmerksoorten (manifestregel, uniek kenmerk, canary) samengevat door een taalmodel zonder instructie om kenmerken te bewaren; daarna geteld welke kenmerken nog aanwezig waren.
Baseline
Het ongewijzigde document, waarin alle drie de kenmerken aantoonbaar aanwezig zijn.
Runs
1
What this does not show
Dat dit voor elk model, elke prompt of elke bewerking geldt. Eén run, één model, één bewerkingssoort. Wat het wél laat zien: herkomstinkt kan niet als sluitende lekdetectie worden verkocht.

Source outputs/ink/survival-2026-08-06.json · measured 2026-08-06

Observation — still missing: herhaling

Worden de vier live oppervlakken vergelijkbaar gemeten?

4 van 4 bereikbaar; 1 op het hoogste niveau, 3 niet ingericht voor een claimprojectie.

Method
Eén meetcontract met vier niveaus (bereikbaar · machineleesbare laag · claimprojectie aan een register · tekstgelijkheid), toegepast op elk oppervlak. Wat een oppervlak niet draagt, wordt gemeld als niet-ingericht, niet als nul.
Baseline
Niveau 0 voor elk oppervlak: zonder meting is er geen stand, en een niet-ingericht niveau telt niet als score.
Runs
1
What this does not show
Zichtbaarheid, verkeer, citaties of effect. Dit contract meet of een oppervlak zegt wat het draagt — niet of iemand het leest. Een hoog niveau is geen publiek dat luistert.

Source outputs/observatory/cross-site-2026-08-12.json · measured 2026-08-12

Every measurement here ages. The dates are on the cards; a stale card is a weaker card and we would rather show that than hide it.
What Agora is · See it work · agora-systems.com