Column Martijn Aslander: Gedigitaliseerd is niet geïnformatiseerd

Onlangs gaf ik een presentatie tijdens de VOGIN-IP-lezing. Na de keynote van Martijn Kleppe van de KB, een heel aimabel en kundig man waar ik veel waardering voor heb, stelde ik hem een vraag: kun je iets zeggen over de kwaliteit van de optical character recognition (OCR) van jullie archief, de character error rate, de word error rate; hoe goed is de tekst die achter jullie scans zit? Zijn antwoord was dat hij dat eigenlijk niet precies wist. En dat was eerlijk en verontrustend tegelijkertijd. Ik kon het niet laten een vervolgvraag te stellen: is het denkbaar dat jullie, als de OCR-kwaliteit toeneemt, het archief nogmaals digitaliseren? Dat antwoord was helder: nee.

Eigen OCR-pijplijn

Mijn vraag kwam niet uit het niets. In de weken voor het congres had ik namelijk een aantal archieven door mijn recent ontworpen OCR-pijplijn gehaald. Op zoek naar online bewijsmateriaal over de betovergrootvader van mijn oma stuitte ik in het Amsterdamse stadsarchief op de registers van de Waterloogratificaties uit 1815. De bonnetjes waren er, als pixels. Uit de metadata op archiefniveau kon ik afleiden welk soort document het was en uit welke periode, maar de tekst op de bonnetjes zelf was niet ontsloten. Na verwerking door mijn pijplijn kwam het uitbetalingsbewijs tevoorschijn, en in het spoor daarvan zijn militaire stamkaart met signalement en staat van dienst, de voorloper van de pasfoto. Waar staatssecretaris Fred Teeven viel over een bonnetje uit 2000 dat het ministerie niet kon terugvinden, haalde ik er een uit 1815 boven water, plus de naam van de man die het bonnetje had getekend.

Daarna kwam het Luhmann Zettelkasten-archief uit Bielefeld: 73.715 kaarten, online beschikbaar als scans, die ik meerdere keren door mijn eigen OCR-pijplijn haalde tot er een robuuste transcriptie lag (zie de column in de vorige IP). Wat onderzoekers voorheen vijftien jaar kostte (en waar ze overigens nog steeds jaren op achterlopen), kon ik dankzij de meest recente technologische ontwikkelingen in één nacht overdoen en afronden.

Niet uniek

Met die ervaring stond ik dus in Amsterdam, en daarom stelde ik Kleppe die vraag. Zijn ‘nee’ is niet uniek voor de KB. Het Nationaal Archief zit in dezelfde situatie, het NIOD ook, en daarnaast nog honderden gemeentearchieven, waterschappen en uitvoeringsorganisaties. Overal liggen miljoenen gescande pagina’s waarvan iedereen aanneemt dat ze ‘digitaal’ zijn, terwijl digitaal en doorzoekbaar en bruikbaar drie wezenlijk verschillende dingen zijn die in de praktijk maar zelden samenvallen. Als we digitaliseren en informatiseren blijven scheiden voor alles wat nu nog moet worden gescand, creëren we dit probleem gewoon elke keer weer opnieuw.

De scan is niet de informatie

De KB heeft in Delpher een enorme hoeveelheid gedigitaliseerde pagina’s, het Nationaal Archief heeft er ook miljoenen liggen, net als het grootste deel van alle overheidsarchieven. En dat wat is gedigitaliseerd is zelden tot nooit geïnformatiseerd.

Wat wél is gedigitaliseerd heeft een probleem dat bijna niemand ziet. Dat je van papier pixels hebt gemaakt, en dus hebt gedigitaliseerd, wil niet zeggen dat je er wat aan hebt. Dit komt doordat de OCR-laag, de door software omgezette pixels naar doorzoekbare tekst, doorgaans fouten bevat. De KB erkent dat zelf: de OCR in Delpher wordt in hun eigen publicaties ‘patchy’ genoemd, en uit intern onderzoek bleek het niet kosteneffectief om bestaand materiaal opnieuw te verwerken met de toen beschikbare software. Al in 2015 stelde een onderzoeker van het CWI op een KB-congres vast dat zelfs de KB niet weet hoe goed of slecht de OCR is. Dat is tien jaar geleden, en aangezien het geen staand beleid is bij de KB om een archief opnieuw te digitaliseren, zal het waarschijnlijk niet zijn veranderd.

Probleem is problematischer

Dit probleem is problematischer dan het op het oog lijkt. Een word error rate of character error rate van 10 procent betekent dat 10 procent van al je woorden of karakters niet klopt. Op 100.000 woorden zijn dat er 10.000, en dat zijn geen willekeurige woorden. Het zijn namen die net iets anders worden gespeld, plaatsen die door een vlek onleesbaar zijn geworden, datums die door kolombreuk in de verkeerde rij terechtkomen. Bij archiefonderzoek komt het vaak aan op het vinden van dat ene woord of die ene persoon om een verhaal sluitend te maken. Als dat ene woord net verkeerd is gespeld, blijft het onzichtbaar voor je zoekmachine, terwijl het er gewoon lag.

Het patroon lijkt na een weekje rondvragen dat als van een papieren collectie eenmaal pixels zijn gemaakt, het zelden gebeurt dat het proces nog een keer wordt overgedaan. Omdat iedereen ervan uitgaat dat die klus immers is geklaard. Opnieuw beginnen voelt als erkennen dat het de eerste keer niet goed genoeg was. Dat is nou net een gegeven waar weinig bestuurders zich aan willen wagen. Begrijpelijk, maar funest.

De aanname achter dat ‘nee’ tijdens de VOGIN-IP-lezing sluit daarop aan: opnieuw OCR toepassen op miljoenen pagina’s kost veel tijd, geld en capaciteit. En dat was lange tijd ook zo. Het lijkt erop dat dat paradigma binnen de archiefsector niet is veranderd.

Meerdere signalen laten samenwerken

Na het evenement in Amsterdam had ik nog een mooie klus. Ik zocht wat aanvullende bronnen en vond de onlangs gedeclassificeerde MI5-archieven over de Tweede Wereldoorlog in Nederland. Maar die waren alleen maar aanwezig in pixels. Mijn pijplijn had hier in no time van 775 pagina’s getypte tekst extreem robuuste, betrouwbare informatie gemaakt. 775 pagina’s met stempels erover, handgeschreven aantekeningen in de marge, meerdere talen door elkaar, in dertien minuten verwerkt op een gewone laptop met gratis opensourcesoftware. De character error rate kwam uit op 3,52 procent, terwijl een enkele standaardengine op hetzelfde materiaal veel slechter presteerde.

Het interessante zit niet in een betere OCR-engine. Het zit in hoe je meerdere signalen laat samenwerken: verschillende engines die dezelfde pagina lezen, een laag die de opbouw van de pagina herkent, en een kennisbank die weet wat er in dit type archief normaal voorkomt. Samen lezen ze meer dan elk afzonderlijk.

Kruising als verificatie

Hier komt iets wat in de hele discussie over OCR-kwaliteit nauwelijks wordt genoemd, terwijl het volgens mij het kernpunt is. Een enkele OCR-lezing van een enkel document is een interpretatie. Of de engine nu ‘Hubertus Carolus’ leest of ‘Hubert’, het blijft een bewering van één systeem over één pagina. Dat is ongemakkelijk, en terecht, want iedere interpretatieve handeling moet ergens zijn vastgelegd en reproduceerbaar zijn.

Wat er verandert zodra je met meerdere bronnen tegelijk werkt, is dat interpretatie plaatsmaakt voor convergentie. Als een OCR-lezing van een doopakte ‘Hubertus Carolus’ oplevert, en Arolsen Archives heeft dezelfde persoon onder diezelfde naam, en de Oorlogsgravenstichting heeft hem ook, dan is de lezing geen interpretatie meer maar een bevestigd feit. Vier onafhankelijke bronnen die op hetzelfde punt samenkomen zijn bewijs, ook als elk van die bronnen afzonderlijk onvolmaakt is. En als drie bronnen ‘Hubertus Carolus’ zeggen en de OCR ‘Hubert’, dan heb je niet alleen een correctere lezing, je hebt ook het bewijs dat de eerste lezing incompleet was. Dat is reproduceerbaar en traceerbaar.

Patronen als ontdekking

Tot hier gaat het om lezen en verifiëren. Maar er is een derde laag, en die vond ik zelf pas toen ik hem zag werken. Een systeem dat weet hoe bekende entiteiten eruitzien in tekst, kan patronen herkennen die het ergens anders nog niet heeft gezien. Dat is geen zoeken, dat is herkennen. En wie herkent, vindt dingen die hij niet zocht.

Een voorbeeld. Ik draaide een test op 2.500 woorden uit Loe de Jong over het Englandspiel. Het systeem herkende eerst zeven namen die het al kende: Schreieder, Giskes, Lauwers, Ridderhof en een paar andere. Uit de context rond die namen leerde het patronen: rang plus naam, organisatie plus afdeling, relatieparen. Die patronen projecteerde het op de rest van de tekst. Vier vermeldingen van ‘Rabagliatti’ kwamen naar boven, een naam die in geen enkel ander archief voorkwam dat ik tot dan toe had verwerkt. Verificatie bevestigde wat het systeem vermoedde: Euan Rabagliatti was hoofd van de Nederlandse sectie van MI6 tijdens de oorlog. Een MI6-sectiehoofd, gevonden door het patroon te volgen in plaats van door te zoeken.

Dat maakt de domeinkennisbank tot iets anders dan alleen een correctielaag. Het is ook een ontdekkingslaag. Elke herkende entiteit leert het systeem hoe entiteiten eruitzien in hun tekstuele omgeving, en elke nieuwe vondst genereert patronen die de volgende vondst mogelijk maken. Correctie, verificatie en ontdekking zijn nu drie lagen op dezelfde tekst. En ze versterken elkaar tot een robuust en betrouwbaar eindresultaat.

Naar optical context recognition

Mark Meinema vatte het mooi samen: van optical character recognition naar optical context recognition. De c staat niet meer voor karakters, maar voor context. Niet de tekens maken de tekst leesbaar, de context maakt de tekens leesbaar.

Hier komt de slag die volgens mij eerder gemaakt had moeten worden, maar die tot voor kort technisch nog niet kon. Als je informatiseert tijdens het digitaliseren, hoef je de OCR-stap daarna niet meer over te doen. Je legt in één doorloop de scan, de tekst en de eerste laag entiteiten vast, en daarmee staat de basis. Dat betekent niet dat het werk voor eeuwig af is, want modellen worden beter en domeinkennis groeit, maar die verbeteringen draaien vanaf dat moment op de tekstlaag. Je hoeft niet meer terug naar de scan.

Dat werkt alleen als de tekstlaag ook echt een laag is waar je mee kunt werken. PDF, DOCX en andere presentatieformaten zijn daar niet geschikt voor: de tekst zit opgesloten in een vormgeving die voor mensen is bedoeld, niet voor verdere bewerking. Open, gestructureerde formaten als Markdown of JSON wél. Daar kan alles bovenop: entiteiten, verbanden, annotaties, verdere verrijking. De keuze voor het bestandsformaat is dus geen technisch randdetail, het bepaalt of het werk ooit nog afraakt of voor altijd vastloopt in eigen vormgeving.

Kennislaag als geheugen

Wat het systeem ondertussen wél blijft doen is groeien. De huidige aanpak in de archief- en informatiewereld is: per collectie een model trainen, met 50 tot 75 handmatig getranscribeerde pagina’s als drempel, en dat per schrijvershand en per periode opnieuw. Bij collecties van enige omvang wordt dat snel onwerkbaar. Wat ik heb gebouwd werkt andersom: standaard OCR-engines aan de onderkant, daarbovenop een groeiende domeinkennisbank met namen, plaatsen, organisaties en vaktermen.

Die kennislaag is in feite een geheugen. Als het systeem in een dossier de naam ‘Hubertus Carolus van der Berg’ tegenkomt, en het heeft die naam al eerder gezien in een andere bron, dan weet het dat de lezing klopt. En als een volgende scan ‘Huhertus Corolus’ oplevert, met twee tikfouten, dan herkent het alsnog wie er wordt bedoeld, omdat het de context al kent. Hoe meer het leest, hoe beter het leest. Omdat de KB, het Nationaal Archief en het NIOD met overlappende domeinen werken, draait dat vliegwiel per domein en niet per instelling.

Geen megaoperatie

Dat in één keer goed doen hoeft ook geen megaoperatie te zijn die jaren duurt en miljoenen kost. Dat is de aanname die het vaakst als argument terugkomt, en die valt met voorbeelden te pareren. 775 pagina’s MI5 in dertien minuten op een laptop is één datapunt. Recent keek ik met mijn lief naar een kerkregister uit Gits uit 1696, met de hand geschreven door een pastoor, op microfiche. De AI las het in seconden, terwijl wij het nauwelijks konden ontcijferen. Niet omdat het model zo bijzonder is, maar omdat een zeventiende-eeuwse doopakte een vaste formule volgt, de context (naam, plaats, jaar) vaak bekend is, en patroonherkenning werkt over miljoenen vergelijkbare documenten tegelijk. Juist bij historisch materiaal helpt de gedeelde structuur, meer dan bij bureaucratisch materiaal uit de twintigste eeuw.

De vaststelling

De heersende aannames dat digitaliseren duur is, dat OCR onbetrouwbaar is, dat opnieuw beginnen onbetaalbaar is, dat handgeschreven materiaal onbereikbaar is, zijn in de afgelopen maanden verdampt. Ik werk al een paar weken elke dag met deze methode en het werkt robuust en snel.

Er is een nieuw hoofdstuk aangebroken in de geschiedenis van het archief- en informatievak. De volgende stap gaat over institutionele keuzes en erkenning van deze mogelijkheden. Ik ben benieuwd welke organisaties als eerste stappen hierin gaan zetten.


Martijn Aslander is technologiefilosoof, internationaal spreker en auteur.

Deze bijdrage komt uit de papieren IP #4-2026. Het hele nummer kun je hieronder lezen of downloaden.