Text aus Bild extrahieren: von Schildern, Seiten, Etiketten und Plakaten
Du hast ein Foto von einer Buchseite, einem Plakat, einem Etikett oder einem Whiteboard und brauchst die Wörter als Text zum Bearbeiten, Suchen oder Übersetzen. Abtippen dauert ewig. Dein todo.is-Agent liest das Bild mit OCR und KI-Bilderkennung, behält die Struktur und markiert jedes Wort, bei dem er sich nicht sicher ist.
Der Prompt
- Lies den Text aus dem/den angehängten Bild(ern): [BILDER ANHÄNGEN]. Der Text ist auf [SPRACHE]. Gib mir alles vollständig und behalte dabei [STRUKTUR]. Ist ein Wort unscharf oder abgeschnitten, schreib deine beste Vermutung mit Fragezeichen dahinter und erfinde niemals Text. Bei mehreren Bildern halte die Reihenfolge ein und kennzeichne jedes. Danach: [ZUSATZ]. Schick das Ergebnis im Chat und als .txt-Datei.
Was du ändern solltest
- [BILDER ANHÄNGEN]: JPG, PNG, HEIC, WebP oder GIF anhängen. Mehrere auf einmal sind kein Problem.
- [SPRACHE]: Z. B. „Deutsch“, „Deutsch und Englisch“ oder „bitte selbst erkennen“.
- [STRUKTUR]: Z. B. „Absätze und Überschriften“, „die Zeilenumbrüche exakt“ oder „Tabellen als Tabellen“.
- [ZUSATZ]: Z. B. „übersetze es ins Englische“, „liste die Kontaktdaten auf“ oder „sonst nichts“.
Beispielergebnis
- Text aus Bild: 3 Fotos
- Erkannte Sprache: Deutsch · 640 Wörter · jedes Foto gekennzeichnet
- Foto 1: IMG_4021.jpg (gedruckte Rezeptkarte, schräg fotografiert)
- Vor dem Lesen begradigt und Kontrast erhöht.
- Omas Apfelkuchen
- Zutaten
- • 250 g Mehl
- • 125 g Butter
- • 100 g Zucker
- • 1 Ei
- • 4 säuerliche Äpfel (z. B. Boskop)
- Zubereitung
- Mehl, Butter, Zucker und Ei zu einem glatten Teig verkneten und 30 Minuten kalt stellen. Die Äpfel schälen, vierteln und [einritzen?]. Den Teig in eine Springform drücken …
- Foto 2: IMG_4022.jpg (Rückseite der Karte, handschriftliche Notiz)
- „Mit Zimt bestreuen! 180 °C, ca. 45 Min.“
- Foto 3: IMG_4023.jpg (Ladenschild)
- Bäckerei Krause · Mo–Fr 7–18 Uhr · Sa 7–[13?] Uhr
- Bitte prüfen
- • Foto 1, Zeile 12: „einritzen?“ ist teilweise vom Daumen verdeckt
- • Foto 3: Die Uhrzeit am Samstag ist verblasst, gelesen als 13
- Was du als Nächstes tun kannst
- Antworte mit „übersetze alles ins Englische“, „mach eine Word-Datei daraus“ oder „mach aus den Zutaten eine Einkaufsliste“.
So geht’s mit todo.is
- Kopiere den Prompt und gib Sprache und gewünschte Struktur an.
- Hänge die Fotos in todo.is an oder schick sie mit dem Prompt einfach per WhatsApp oder Telegram an deinen Agenten.
- Dein Agent bereitet jedes Bild auf, liest es und markiert Wörter, bei denen er unsicher ist.
- Kopiere den Text aus dem Chat oder lade die .txt herunter. Übersetzung oder Word-Datei bekommst du im selben Verlauf.
Tipps für ein besseres Ergebnis
- Fotografiere gerade von vorn, bei gutem Licht, und lass den Text das Bild füllen. Das zählt mehr als die Kameraqualität.
- Bei mehrseitigen Dokumenten liefert ein PDF-Scan bessere Ergebnisse als einzelne Fotos.
- Nenn die Sprache, vor allem bei gemischten Texten, Umlauten oder Eigennamen. Das senkt die Fehlerquote deutlich.
- Unklare Wörter in Klammern halten den Text ehrlich: Du prüfst zwei Wörter statt der ganzen Seite.
Text aus Bild extrahieren: häufige Fragen
- Wie kann ich Text aus einem Bild extrahieren? Hänge das Bild an und bitte deinen Agenten, es zu lesen. Er nutzt OCR und KI-Bilderkennung und gibt dir den Text mit Absätzen und Listen zurück.
- Klappt das auch mit Handyfotos? Ja. Dein Agent begradigt und schärft das Foto vorher. Bei sehr unscharfen oder dunklen Fotos können Wörter unklar bleiben, die er dann markiert.
- Welche Bildformate gehen? JPG, PNG, HEIC vom iPhone, WebP, GIF und TIFF. Jeder Upload darf bis zu 50 MB groß sein.
- Kann die KI auch Handschrift lesen? Gut leserliche Handschrift meist ja, wie die Notiz im Beispiel. Bei schwer lesbarer Schrift markiert dein Agent unsichere Wörter, statt zu raten.
JavaScript is required to use the todo.is app.