
U opent een PDF die u per e-mail heeft ontvangen, u probeert een zin te selecteren, en er gebeurt niets. De cursor glijdt over de pagina zonder ook maar één woord te raken. Dit document is waarschijnlijk een eenvoudige afbeelding, zonder een bruikbare tekstlaag. Weten of een PDF tekst bevat die door OCR wordt herkend, bepaalt uw vermogen om te zoeken, te kopiëren of het toegankelijk te maken. Verschillende online methoden maken het mogelijk om dit in enkele seconden te controleren, zonder software te installeren.
De tekstlaag in een PDF: wat de selectie niet altijd zegt
De eerste reactie op een verdachte PDF is om te proberen tekst met de muis te selecteren. Als woorden worden gemarkeerd, bevat het document inderdaad een tekstlaag. Maar deze methode heeft zijn beperkingen.
Sommige PDF’s bevatten een gedeeltelijke tekstlaag. De OCR heeft misschien slechts een deel van de pagina’s verwerkt, of de herkenning heeft inconsistente resultaten opgeleverd. U selecteert tekst, plakt deze in een editor, en u krijgt tekens die geen verband houden met de zichtbare inhoud. Een selecteerbare tekst is niet altijd een betrouwbare tekst.
Om verder te gaan, is er een aanvullende benadering: probeer een Ctrl+F (of Cmd+F op Mac) en zoek naar een duidelijk zichtbaar woord op de pagina. Als de zoekopdracht niets vindt, is de tekstlaag afwezig of onbruikbaar. Deze controle duurt enkele seconden en levert een meer sprekend resultaat op dan alleen de selectie.
Wanneer u een nauwkeuriger diagnose nodig heeft, kunt u de tekstherkenning van een PDF-document controleren met behulp van speciale tools die de interne structuur van het bestand analyseren.

Online tools om een PDF te analyseren zonder de OCR opnieuw uit te voeren
De meeste online diensten bieden de mogelijkheid om een optische tekenherkenning op uw bestand uit te voeren. Maar voordat u al het OCR-werk opnieuw doet, kan het nuttig zijn om eenvoudig te controleren of de PDF al bruikbare tekst bevat.
Tekstextractie als snelle test
Diensten zoals de PDF-analyzer van Aspose maken het mogelijk om de tekstuele inhoud van een document te extraheren. Het principe is eenvoudig: u uploadt uw bestand, de tool probeert er platte tekst uit te halen. Als er geen tekst wordt geëxtraheerd, is het bestand een PDF-afbeelding zonder OCR.
Deze methode wijzigt uw document niet. Het leest alleen wat al in de structuur van het bestand bestaat. U krijgt een diagnose zonder de originele PDF te veranderen.
Controle via toegankelijkheid
Een andere, minder bekende benadering, maakt gebruik van toegankelijkheidscontroletools. De PDF Accessibility Checker (PAC) controleert of een document bruikbare tekstuele inhoud bevat voor schermlezers. Een puur afbeeldings-PDF faalt systematisch in deze test.
Met de opkomst van de PDF/UA- en WCAG 2.2-normen worden deze controles steeds vaker gebruikt om de conformiteit van documenten die online worden gepubliceerd te controleren. Een toegankelijkheidscontrole detecteert op betrouwbare wijze de afwezigheid van een tekstlaag.
PDF-tekstherkenning: de veelvoorkomende valkuilen van online OCR-tools
U heeft vastgesteld dat uw PDF geen tekst bevat. U besluit een online OCR-tool te gebruiken om het probleem op te lossen. Enkele voorzorgsmaatregelen zijn nodig voordat u het resultaat bevestigt.
De taal van het document maakt alles uit
De meeste online OCR-tools detecteren automatisch de taal. In de praktijk werkt deze detectie goed voor documenten in het Engels of in gangbaar Frans. Bij meertalige, technische documenten of documenten met gespecialiseerde termen, daalt de nauwkeurigheid van de OCR aanzienlijk.
Vergeet niet om handmatig de taal te selecteren voordat u de herkenning start. Een document in het Duits dat als Frans wordt behandeld, zal een tekstlaag opleveren die vol fouten zit die met het blote oog niet zichtbaar zijn, maar die elke zoekopdracht in het bestand onbruikbaar maken.
Kwaliteit van de scan en resolutie
Een PDF die afkomstig is van een scan van slechte kwaliteit, vormt problemen voor alle OCR-motoren. Scheve pagina’s, vlekken, laag contrast: deze defecten verslechteren de herkenning veel meer dan de keuze van de tool zelf.
Controleer deze punten op uw bestand voordat u een online OCR start:
- Zijn de pagina’s recht, of vertonen sommige een zichtbare helling met het blote oog?
- Is het contrast tussen de tekst en de achtergrond voldoende om elk teken te onderscheiden?
- Bevat het document handgeschreven annotaties, stempels of markeringen die de afgedrukte tekst bedekken?
Sommige tools zoals PDF24 bieden opties voor voorbewerking (rechtzetten van pagina’s, ruisonderdrukking). Deze instellingen inschakelen voordat u de OCR uitvoert, verbetert het eindresultaat aanzienlijk.

PDF afbeelding of PDF tekst: hoe de twee in de praktijk te onderscheiden
Een PDF kan er op het scherm precies hetzelfde uitzien, of het nu een tekstlaag bevat of niet. Het verschil is onzichtbaar, maar de gevolgen zijn concreet.
Een PDF afbeelding is een bestand waarbij elke pagina een foto is. Niets is indexeerbaar, niets is kopieerbaar. Een PDF tekst bevat gecodeerde tekens die de PDF-lezer kan interpreteren: zoeken, kopiëren, spraaklezen, alles werkt.
Er is ook een tussenliggende situatie: de “sandwich” PDF. De afbeelding van de scan blijft zichtbaar, maar een onzichtbare tekstlaag is er bovenop gelegd dankzij de OCR. Dit is het formaat dat de meeste online herkenningstools produceren. Visueel identiek aan het origineel, wordt het doorzoekbaar en toegankelijk.
Om te weten in welke situatie u zich bevindt, combineert u twee controles:
- Probeer tekst te selecteren en te kopiëren, en plak deze in een editor om te zien of de tekens overeenkomen met de zichtbare inhoud.
- Voer een Ctrl+F-zoekopdracht uit op een woord dat u duidelijk op de pagina ziet.
- Gebruik een online tekstextractietool om een geautomatiseerde diagnose te krijgen, zonder het bestand te wijzigen.
Deze drie handelingen duren minder dan een minuut. Ze zijn in de meeste gevallen voldoende om vast te stellen of uw document een OCR-tool nodig heeft of dat het al bruikbaar is in zijn huidige staat.
De tekstherkenning in een PDF is niet alleen een kwestie van gemak. Een document zonder tekstlaag zal niet correct worden geïndexeerd door een zoekmachine, noch leesbaar zijn door een spraakondersteunend hulpmiddel. Dit punt controleren voordat u een bestand publiceert of archiveert, voorkomt kostbare correcties achteraf.