Software Briefing
Text aus Bildern holen: OCR für Rechnungen, Scans und Screenshots
OCR macht Text in Fotos, Screenshots und Scan-PDFs kopierbar oder durchsuchbar. Dieser Guide zeigt den schnellsten Weg je nach Aufgabe, erklärt die Grenzen bei Rechnungen und hilft beim Prüfen von Ergebnis und Datenschutz.
Aktualisierung: Komplett neu aufgebaut: konkrete Wege für Screenshots, Scan-PDFs und Rechnungen, Auswahlmatrix, Prüfprotokoll, Datenschutz und E-Rechnungs-Abgrenzung ergänzt.
Dieses Bild wurde mit KI erstellt.Kurz gesagt
OCR macht Text in Fotos, Screenshots und Scan-PDFs kopierbar oder durchsuchbar. Dieser Guide zeigt den schnellsten Weg je nach Aufgabe, erklärt die Grenzen bei Rechnungen und hilft beim Prüfen von Ergebnis und Datenschutz.
OCR („Optical Character Recognition“, deutsch: optische Zeichenerkennung) macht Zeichen in einem Bild zu maschinenlesbarem Text. Dieser lässt sich kopieren, durchsuchen oder an ein anderes Programm übergeben.
Meine wichtigste Regel: Je größer der Schaden eines Fehlers wäre, desto genauer muss die Kontrolle sein. Ein falsch erkanntes Wort in einer privaten Notiz ist meist harmlos. Eine falsche IBAN, ein vertauschtes Komma im Rechnungsbetrag oder eine fehlerhafte Vertragsfrist ist es nicht.
Die schnellste Wahl
- Einzelner Screenshot oder Foto: integrierte Texterkennung auf dem Gerät.
- Gescannter Brief oder Bild-PDF: OCR mit Ausgabe als durchsuchbares PDF.
- Viele Rechnungen mit festen Ziel-Feldern: Rechnungs- oder Dokumentenerkennung mit Kontrollschritt.
- Vertrauliche Unterlagen: lokale Verarbeitung oder ein vom Unternehmen freigegebener Cloud-Dienst.
- Handschrift, Tabellen oder schlechte Fotos: erst mit eigenen Beispielen testen und mehr Handkontrolle einplanen.
Was OCR kann – und was nicht
Entscheidend ist, welche Ausgabe du brauchst. Ein Scan besteht für den Computer zunächst nur aus Pixeln; erst die Erkennung macht den Text weiterverwendbar.
Das Ergebnis kann drei verschiedene Formen haben:
- Kopierter Klartext: praktisch für ein Zitat, eine Adresse oder eine Seriennummer.
- Durchsuchbares PDF: das Seitenbild bleibt sichtbar; zusätzlich liegt eine unsichtbare Textschicht darüber.
- Strukturierte Daten: ein spezielles System ordnet erkannte Werte Feldern wie Rechnungsnummer, Datum oder Gesamtbetrag zu.
Der dritte Punkt ist wichtig. OCR erkennt Zeichen, ordnet einen Betrag aber nicht zuverlässig automatisch dem richtigen Rechnungsfeld zu. Dafür braucht es Layout- und Dokumentverständnis – und bei geschäftskritischen Daten weiterhin eine Prüfung.
| Aufgabe | Passender Startpunkt | Warum | Unbedingt prüfen |
|---|---|---|---|
| Text aus einem Screenshot kopieren | Gerätefunktion | Schnell, ohne neuen Arbeitsablauf | Zeilenumbrüche, Sonderzeichen, Codes |
| Einzelnes Scan-PDF durchsuchen | PDF-OCR | Erhält die Seite und ergänzt eine Textschicht | Vollständigkeit und richtige Lesereihenfolge |
| Viele ähnliche Rechnungen erfassen | Dokumenten- oder Rechnungsmodell | Kann Felder und Positionen strukturiert ausgeben | Betrag, Steuer, Datum, Rechnungsnummer, IBAN |
| Vertrauliche Dokumente verarbeiten | Lokal oder freigegebener Dienst | Datenweg bleibt kontrollierbar | Vertrag, Speicherort, Löschung, Zugriffsrechte |
| Handschrift oder schwieriges Layout | Speziallösung plus manuelle Kontrolle | Allgemeines OCR stößt schneller an Grenzen | Jedes entscheidende Feld |
Text aus einem Bild holen: der Ablauf in fünf Schritten
1. Prüfe zuerst, ob OCR überhaupt nötig ist
Versuche, ein Wort zu markieren oder mit der Suchfunktion zu finden. Funktioniert das, enthält die Datei bereits Text. Eine zweite OCR-Runde kann dann unnötig sein und bei manchen Verfahren die Qualität sogar verschlechtern.
Bei einem Scan-PDF erkennst du den Unterschied oft so: Du kannst die Seite sehen, aber kein einzelnes Wort auswählen. Dann fehlt wahrscheinlich die Textschicht.
2. Mache das Bild lesbar
Lege Papier flach hin, sorge für gleichmäßiges Licht und halte die Kamera möglichst gerade über die Seite. Schneide Tisch, Finger und andere Dokumente aus dem Bild. Wähle im OCR-Werkzeug die richtige Sprache; bei gemischten Dokumenten können mehrere Sprachmodelle nötig sein.
Schieflage, Schatten, Rauschen, sehr kleine Schrift und falsche Seitenausrichtung erschweren die Erkennung. Die Tesseract-Dokumentation nennt unter anderem Entzerren, Rauschminderung, Kontrast und passende Seitensegmentierung als wichtige Stellschrauben.
3. Bestimme das gewünschte Ergebnis
Wichtiger als die Frage nach dem besten OCR ist: Was soll danach passieren?
- Für eine Telefonnummer brauchst du kopierbaren Text.
- Für ein Archiv brauchst du eher ein durchsuchbares PDF.
- Für Buchhaltung brauchst du klar zugeordnete Felder und einen Export.
- Für Barrierefreiheit reicht eine Textschicht allein nicht immer; auch Lesereihenfolge und Dokumentstruktur müssen stimmen.
4. Starte mit der kleinsten passenden Lösung
Auf dem iPhone oder iPad: Öffne das Foto, tippe auf die Schaltfläche zur Texterkennung, markiere den gewünschten Abschnitt und kopiere ihn. Apple beschreibt diese Funktion als „Live Text“ für Fotos, Videos und weitere Ansichten.
Unter Windows 11: Erstelle einen Ausschnitt, wähle in der geöffneten Aufnahme „Text Actions“ und kopiere den gewünschten Abschnitt. Microsoft gibt an, dass diese Erkennung lokal auf dem Gerät erfolgt.
In OneNote: Verwende die OCR-Funktion für ein eingefügtes Bild oder einen Dateiausdruck. Microsoft warnt selbst, dass die Qualität vom Ausgangsbild abhängt und das Ergebnis geprüft werden sollte.
Bei einem gescannten PDF: Nutze eine PDF-OCR und speichere in eine neue Ausgabedatei. Adobe empfiehlt ausdrücklich eine Sicherungskopie des ursprünglichen Scans; die OCR ergänzt eine durchsuchbare Textschicht. Lokale Werkzeuge wie OCRmyPDF können Seiten drehen, leichte Schieflagen korrigieren und die Dokumentsprache festlegen. Für die Auswahl der relevanten Stellen hilft anschließend der Saaspective-Guide lange PDFs gezielt zu durchsuchen.
5. Kontrolliere das Ergebnis dort, wo Fehler teuer werden
Lies nicht automatisch das ganze Dokument Zeichen für Zeichen gegen. Prüfe risikobasiert: Namen, Fristen, Kontodaten, Beträge, Kennzeichen, Produktcodes und alle Werte, die einen Folgeprozess auslösen.
Kopiere testweise eine schwierige Zeile in einen einfachen Texteditor. Suche im PDF nach einem Wort vom Seitenende. Bei Tabellen solltest du außerdem prüfen, ob Werte noch in der richtigen Zeile und Spalte stehen.
| Feld | Typischer OCR-Fehler | Folge | Kontrolle |
|---|---|---|---|
| Rechnungsnummer | O/0, I/1, fehlender Bindestrich | Falsche Zuordnung oder Dublette | Exakt mit dem sichtbaren Beleg vergleichen |
| Rechnungsdatum und Fälligkeit | Tag und Monat vertauscht | Falsche Frist oder Buchungsperiode | Datum im Kontext der Rechnung prüfen |
| Netto, Steuer, Brutto | Komma, Punkt oder Ziffer falsch | Falscher Buchungs- oder Zahlbetrag | Werte und Rechenzusammenhang vergleichen |
| IBAN | Ein Zeichen falsch oder ausgelassen | Fehlgeleitete oder blockierte Zahlung | Nicht ungeprüft aus OCR übernehmen |
| Positionen | Zeilen oder Spalten vermischt | Falsche Menge, Steuer oder Kostenstelle | Stichprobe plus Summenabgleich |
Rechnungen: OCR ist nicht dasselbe wie Rechnungsautomatisierung
Für wenige Belege kann OCR plus Handkontrolle völlig ausreichen. Wenn viele Rechnungen in ein Buchhaltungs- oder Freigabesystem gelangen sollen, wird die Zuordnung wichtiger als der reine Text. Spezielle Rechnungsmodelle können etwa Rechnungsnummer, Lieferant, Fälligkeit, Gesamtbetrag und Positionen als getrennte Felder ausgeben. Das spart Übertragungsarbeit, macht die Werte aber nicht automatisch wahr.
Noch eine wichtige Abgrenzung für Deutschland: Ein mit OCR durchsuchbar gemachtes einfaches PDF wird dadurch nicht zu einer E-Rechnung im steuerlichen Sinn. Das Bundesfinanzministerium erklärt, dass seit dem 1. Januar 2025 ein strukturiertes elektronisches Format nötig ist; ein einfaches PDF erfüllt diese Definition nicht. Wer einen vollständigen Rechnungsprozess auswählt, findet im Vergleich Lexware Office, sevdesk oder DATEV für E-Rechnungen die wichtigeren Prozessfragen.
So vergleichst du OCR-Werkzeuge ohne erfundene Genauigkeitszahl
Eine pauschale Aussage wie „99 Prozent genau“ hilft wenig, wenn gerade eine IBAN falsch ist. Die Qualität hängt vom Dokument, der Sprache, dem Layout, der Bildqualität und vom gewünschten Ergebnis ab. OCR-D empfiehlt für eine belastbare Bewertung repräsentative Originalbilder und manuell geprüfte Vergleichstexte, sogenannte Ground Truth.
Ich würde deshalb kein Werkzeug nur anhand einer perfekten Demo auswählen. Ein kleiner, wiederholbarer Test mit eigenen Dokumenten ist aussagekräftiger:
- Stelle eine Stichprobe aus deinen echten Fällen zusammen: sauberer Scan, schiefes Handyfoto, kleine Schrift, Tabelle, mehrsprachige Seite und ein schwieriger Beleg.
- Schreibe die entscheidenden Zielwerte korrekt auf, bevor du die Werkzeuge startest.
- Nutze in jedem Werkzeug dieselben Dateien und möglichst dieselben Ausgabeeinstellungen.
- Zähle für kritische Felder nur exakte Treffer. Eine einfache Kennzahl ist: exakt richtige Felder ÷ geprüfte Felder × 100.
- Miss zusätzlich die Korrekturzeit pro Dokument und notiere Komplettausfälle.
- Prüfe den Export im echten Zielsystem. Ein gutes OCR-Ergebnis nützt wenig, wenn Zeilen, Umlaute oder Tabellen beim Export zerfallen.
Das ist keine Laborstudie, sondern ein praxistauglicher Abnahmetest. Sein Vorteil: Er bewertet genau den Ablauf, für den du später Zeit und Verantwortung übernimmst.
Lokal oder Cloud: Datenschutz nach Datenweg entscheiden
„Lokal“ und „Cloud“ sagen zunächst nur, wo das Dokument verarbeitet wird.
Enthält ein Bild personenbezogene Daten, gelten die Datenschutzregeln unabhängig davon, ob die OCR-Funktion kostenlos oder kostenpflichtig ist. Bei einem externen Dienst solltest du mindestens klären:
- Welche Daten werden hochgeladen?
- Wo und wie lange werden Eingaben und Ergebnisse gespeichert?
- Nutzt der Anbieter Inhalte zur Verbesserung seiner Modelle?
- Wer hat Zugriff, und welche Unterauftragsverarbeiter sind beteiligt?
- Gibt es für die Verarbeitung im Auftrag eine passende Vereinbarung?
- Lassen sich Daten löschen und Zugriffe protokollieren?
Die DSGVO verlangt unter anderem Zweckbindung und Datenminimierung; für Auftragsverarbeiter enthält Artikel 28 konkrete Vertragsanforderungen. Lokale Verarbeitung kann einen externen Upload vermeiden, ersetzt aber keine Rechteverwaltung, Geräteverschlüsselung oder sichere Ablage.
Meine Einschätzung: Für einen öffentlichen Screenshot ist Bequemlichkeit oft der entscheidende Punkt. Bei Personalunterlagen, Verträgen, Ausweisen oder Kundenrechnungen sollte zuerst der erlaubte Datenweg feststehen – erst danach das Werkzeug.
Häufige Fehler – und die bessere Lösung
Das Foto ist schief oder hat Schatten
Nimm es neu auf, statt lange an Filtern zu drehen. Halte die Kamera parallel zur Seite und nutze gleichmäßiges Licht.
Text wird erkannt, aber die Tabelle ist unbrauchbar
Wechsle von einfachem OCR zu einem Werkzeug mit Layout-, Tabellen- oder Dokumenterkennung. Prüfe trotzdem Zeilen und Summen.
Das PDF ist durchsuchbar, findet aber manche Wörter nicht
Prüfe die Dokumentsprache, Seitenausrichtung und eine schwierige Textstelle. Speichere das Ergebnis als neue Datei und behalte das Original.
Die Handschrift wird falsch erkannt
Handschrift ist ein eigener schwieriger Fall. Nutze ein Werkzeug, das sie ausdrücklich unterstützt, und rechne bei wichtigen Inhalten mit vollständiger Kontrolle.
Umlaute oder Codes sind falsch
Stelle die richtige Sprache ein. Bei Seriennummern, Artikelcodes und IBANs helfen Wörterbücher wenig; hier zählt der Zeichenvergleich.
Häufige Fragen
Kann OCR Handschrift lesen?
Manche Systeme können Handschrift erkennen, doch die Qualität hängt stark von Schrift, Sprache und Bild ab. Für Fristen, Beträge oder andere wichtige Werte solltest du das Ergebnis vollständig prüfen.
Macht OCR ein PDF barrierefrei?
OCR schafft eine wichtige Textgrundlage, aber nicht automatisch ein vollständig barrierefreies PDF. Die W3C-Technikempfehlung verlangt unter anderem eine Prüfung von Vollständigkeit und Lesereihenfolge; für echte Barrierefreiheit können zusätzlich Tags und Struktur nötig sein.
Verändert OCR das Original?
Das hängt vom Werkzeug und den Einstellungen ab. Manche Programme ergänzen nur eine Textschicht, andere rechnen Seiten neu oder bereinigen Bilder. Bewahre deshalb die unveränderte Eingangsdatei auf und schreibe das Ergebnis in eine neue Datei.
Ist kostenlose Online-OCR sicher?
Der Preis beantwortet diese Frage nicht. Entscheidend sind Datenweg, Speicherung, Vertragslage und deine Dokumentart. Lade vertrauliche Dateien nicht hoch, bevor diese Punkte geklärt sind.
Übersetzt OCR den erkannten Text?
OCR erkennt Zeichen. Übersetzung ist ein zweiter Verarbeitungsschritt. Einige Apps verbinden beides, aber du solltest Erkennung und Übersetzung getrennt prüfen.
Fazit
Für einen Screenshot ist die eingebaute Gerätefunktion meist der beste Anfang. Für Archive zählt ein durchsuchbares PDF. Bei Rechnungen zählen strukturierte Felder, ein sauberer Export und die Kontrolle kritischer Werte. Und bei sensiblen Dokumenten entscheidet nicht das schönste Ergebnis, sondern ein erlaubter, nachvollziehbarer Datenweg.
Wenn du nur einen Gedanken mitnimmst, dann diesen: Wähle OCR nicht nach der längsten Funktionsliste, sondern nach Ausgabe, Fehlerrisiko und deinem nächsten Arbeitsschritt.
Quellen
- https://support.apple.com/en-ie/guide/iphone/iph37fdd714b/ios
- https://support.microsoft.com/en-US/Windows/Apps/use-snipping-tool-to-capture-screenshots
- https://support.microsoft.com/de-de/onenote/onenote-help-and-learning/copy-text-from-pictures-and-file-printouts-using-ocr-in-onenote
- https://helpx.adobe.com/de/acrobat/desktop/create-documents/scan-documents-to-pdfs/recognize-text.html
- https://tesseract-ocr.github.io/tessdoc/ImproveQuality.html
- https://ocrmypdf.readthedocs.io/en/stable/cookbook.html
- https://www.bundesfinanzministerium.de/Content/DE/FAQ/e-rechnung.html
- https://learn.microsoft.com/en-us/azure/ai-services/document-intelligence/prebuilt/invoice?view=doc-intel-4.0.0
- https://ocr-d.de/en/spec/ocrd_eval.html
- https://www.w3.org/WAI/WCAG22/Techniques/pdf/PDF7
- https://eur-lex.europa.eu/eli/reg/2016/679/oj/eng
Weitere Artikel aus AI Tools
GPT-5.6 Sol vs. Claude Fable 5: Welche KI passt zu welcher Aufgabe?
Kurz gesagt: Sol ist im Standardtarif günstiger, Fable 5 für besonders lange Arbeit positioniert. Ein eigener Pilot entscheidet. Bei verbindlicher ZDR-Anforderung passt Fable 5 unter den am 6. August 2026 dokumentierten Bedingungen nicht.

Targets AI-Vorteil liegt nicht im Modell, sondern im Betrieb
Target zeigt, dass Daten, Filialprozesse, Feedback und Integration schwerer kopierbar sind als ein Modell. Der Moat entsteht im Betrieb.

KI-Kennzeichnung ab August 2026: Was Unternehmen jetzt prüfen müssen
Artikel 50 des EU AI Act bringt ab 2. August 2026 Transparenzpflichten für bestimmte AI-Systeme und synthetische Inhalte. Nicht jeder AI-Text braucht dasselbe Label.
