PDF · lokal im Browser · ohne Upload
Text aus PDF extrahieren
Liest den Text aller Seiten in Lesereihenfolge, zeigt ihn Seite für Seite und speichert ihn als Textdatei. Die PDFs verlassen Ihr Gerät dabei nicht.
Bleibt auf Ihrem Gerät. aktenadler liest und schreibt die PDFs hier im Browser. Nichts wird hochgeladen.
Geöffnete Dateien
- Noch keine Datei geöffnet.
PDFs zusammenfügen
Alle Seiten der Seitenübersicht werden in ihrer Reihenfolge ein PDF. Ganze Dateien verschieben Sie in der Dateiliste, einzelne Seiten in der Übersicht.
PDF teilen
Jeder Bereich wird ein eigenes PDF. Die Zahlen sind die Positionen in der Seitenübersicht, „8-“ heißt ab Seite 8.
Seiten drehen, ordnen und löschen
Markieren Sie Seiten in der Übersicht und nutzen Sie die Knöpfe darüber, die Tastatur oder Strg + K. Die Maus kann Seiten auch ziehen.
- Pfeiltasten
- zur nächsten Seite
- Leertaste
- Seite markieren oder abwählen
- Umschalt + Pfeiltaste
- Bereich markieren
- Strg + A
- alle Seiten markieren
- R, Umschalt + R
- 90° nach rechts, nach links drehen
- Alt + Pfeiltaste
- markierte Seiten verschieben
- Entf
- markierte Seiten löschen
- Strg + Z, Strg + Umschalt + Z
- rückgängig, wiederholen
- Strg + K
- alle Befehle
Text extrahieren
Liest den Text aller Seiten der Übersicht in Lesereihenfolge. Gescannte Seiten ohne Textebene bleiben leer: eine Texterkennung hat aktenadler nicht.
ZUGFeRD und Factur-X
Rechnungs-XML herausholen
Beim Öffnen sucht aktenadler in jedem PDF nach einer eingebetteten Rechnung.
Noch kein PDF geöffnet.
Rechnungs-XML einbetten
Macht aus dem PDF der Seitenübersicht eine ZUGFeRD-Rechnung: die CII-XML wird als zugeordnete Datei mit den Factur-X-Metadaten eingebettet. Die XML erzeugt die E-Rechnungs-App; das PDF der Rechnung zum Beispiel deren Vorschau über „Drucken“ und „Als PDF speichern“.
Noch keine XML-Rechnung gewählt.
Eine ZUGFeRD-Rechnung ist nach der Spezifikation ein PDF/A-3. aktenadler prüft vor der Ausgabe vier Regeln: keine Verschlüsselung, alle Schriften eingebettet, ein Ausgabefarbraum, kein JavaScript, und dazu, ob sich das Ausgangs-PDF als PDF/A-2 oder PDF/A-3 erklärt. Sind alle erfüllt, übernimmt das Ergebnis das Farbprofil und erklärt sich als PDF/A-3b; sonst nennt es den Grund. Erfüllt sind sie nur bei einem Ausgangs-PDF, das seine Schriften schon eingebettet hat, wie es ein Rechnungsprogramm mit PDF/A-Option liefert. Das vollständige PDF/A-Regelwerk prüft aktenadler nicht.
Seite ansehen und untersuchen
Zeigt die Seite, die in der Übersicht den Fokus hat.
Öffnen Sie ein PDF, um es hier anzusehen.
Dokument
- Datei
- keine geöffnet
Protokoll des PDF-Lesers
Seiten
Noch keine Seiten. Öffnen Sie ein oder mehrere PDFs.
Pfeiltasten wählen eine Seite, die Leertaste markiert sie. Die Tastenkürzel stehen unter „Drehen und ordnen“.
Ergebnisse
Noch keine. Fertige Dateien erscheinen hier als Links zum Speichern.
Text extrahieren in drei Schritten
-
PDF öffnen
Wählen Sie eine oder mehrere Dateien über „PDF öffnen“ aus. Seiten, die Sie nicht brauchen, löschen Sie vorher in der Übersicht.
-
Text extrahieren
Ein Klick auf „Text extrahieren“ liest alle Seiten der Übersicht. Der Text erscheint darunter, mit einer Überschrift je Seite.
-
Als Textdatei speichern
Unter „Ergebnisse“ liegt der gesamte Text als .txt-Datei in UTF-8, etwa vertrag-text.txt, bereit für jeden Editor.
Wann kein Text herauskommt
aktenadler liest den Text, der im PDF als Text gespeichert ist. Das gilt für fast alle PDFs, die aus Word, einem Buchhaltungsprogramm oder einem Browser erzeugt wurden.
- Gescannte Seiten sind Bilder ohne Textebene. Eine Texterkennung (OCR) hat aktenadler nicht; solche Seiten bleiben leer und werden als „(kein Text auf dieser Seite)“ angezeigt.
- Schriften ohne Zeichenzuordnung kommen in manchen PDFs vor. Dann steht im PDF nur die Form der Buchstaben, nicht welcher Buchstabe gemeint ist, und das Ergebnis enthält falsche Zeichen.
- Tabellen und Spalten werden als Fließtext in Lesereihenfolge ausgegeben, nicht als Tabelle.
Enthält das PDF eine E-Rechnung im ZUGFeRD-Format, sind die Rechnungsdaten als XML eingebettet und damit genauer als der Text der Seite. Das ZUGFeRD-Werkzeug holt sie heraus, die E-Rechnungs-Ansicht zeigt sie lesbar an.
Ohne Upload, und so prüfen Sie das selbst
aktenadler liest und schreibt die PDFs mit JavaScript in diesem Browser-Tab. Beim Öffnen der Seite lädt Ihr Browser die Programmdateien von aktenadler.com und meldet einen Seitenaufruf an die eigene Statistik, ohne Dateinamen und ohne Inhalte. Ihre PDF selbst wird nie übertragen.
Nachprüfen können Sie das in jedem Browser: Entwicklerwerkzeuge öffnen (F12), den Reiter „Netzwerk“ wählen, dann eine PDF öffnen und den Text extrahieren. In der Liste erscheint keine Anfrage mit Ihrer Datei. Die automatischen Tests von aktenadler prüfen das beim Zusammenfügen bei jeder Änderung am Code.
Häufige Fragen
Kann aktenadler gescannte PDFs lesen?
Nein. Gescannte Seiten sind Bilder, und eine Texterkennung (OCR) hat aktenadler nicht. Solche Seiten bleiben im Ergebnis leer.
Bleibt die Formatierung erhalten?
Nein. Das Ergebnis ist reiner Text in Lesereihenfolge, ohne Schriftarten, Tabellen und Bilder. Für jede Seite gibt es eine Überschrift mit Datei und Seitennummer.
In welcher Kodierung wird die Textdatei gespeichert?
In UTF-8. Umlaute, ß und Sonderzeichen bleiben erhalten, jeder aktuelle Editor öffnet die Datei richtig.
Kann ich den Text mehrerer PDFs auf einmal extrahieren?
Ja. Öffnen Sie alle Dateien; aktenadler liest die Seiten in der Reihenfolge der Übersicht und schreibt sie in eine Textdatei.
Passende Werkzeuge
- PDF zusammenfügen Mehrere PDFs zu einer Datei, in Ihrer Reihenfolge
- PDF teilen Nach Seitenbereichen, in Einzelseiten oder als Auszug
- PDF-Seiten drehen Einzelne oder alle Seiten, dauerhaft gespeichert
- PDF-Seiten löschen und sortieren Seiten entfernen, verschieben, neu ordnen
- ZUGFeRD-PDF erstellen Rechnungs-XML in ein PDF einbetten oder herausholen
- PDFs vergleichen Text- und visueller Unterschied zweier PDFs