10 Gesamtergebnis
Kapitel | Oct | Mi | GeM | Pop | ChM | Op | GeX | ChX |
Überschriften, Dokumentstruktur und Seitenlayout | 123 | 69 | 100 | 43 | 131 | 59 | 133 | 25 |
Textauszeichnungen und Inline-Formatierung | 35 | 23 | 20,05 | 24,2 | 37,55 | 18,6 | 23 | 1,15 |
Sonderzeichen, Zahlen und Schriftarten | 14,58 | 15,6 | 11,8 | 14,1 | 15,8 | 14 | 6,8 | 0,5 |
Mehrspaltigkeit | 31,8 | 32,8 | 32,9 | 31 | 32,9 | 32,6 | 31 | 0 |
Fußnoten, Endnoten und Literaturverweise | 70 | 17 | 28 | 20 | 80 | 20 | 29 | 0 |
Mehrsprachigkeit | 10 | 10 | 10 | 6,8 | 10 | 6,8 | 2,5 | 1 |
Bilder, Schaubilder und Diagramme | 70 | 37,5 | 4,5 | 1,5 | 100 | 8,75 | 10 | 2,25 |
Tabellen | 119 | 91,5 | 93 | 6 | 120 | 86 | 41,5 | 20 |
Listen und Aufzählungen | 35,9 | 37,5 | 43 | 36,5 | 43 | 33,4 | 11,5 | 4 |
Mathematische Inhalte und Formeln | 6,25 | 19,5 | 19 | 6 | 19,75 | 6 | 5 | 0,25 |
Textboxen | 5 | 5 | 5 | 5 | 10 | 5 | 0 | 0 |
Literaturverzeichnis | 30 | 30 | 30 | 30 | 30 | 10 | 32 | 6,5 |
Index | 7 | 7 | 7 | 7 | 7 | 5 | 5,5 | 0 |
Über alle Kapitel hinweg zu erreichende Punkte | 712 | 712 | 712 | 712 | 712 | 712 | 712 | 712 |
Über alle Kapitel hinweg erreichte Punkte | 557,53 | 395,4 | 404,25 | 231,1 | 637 | 305,15 | 330,8 | 60,65 |
Erreichte Prozent | 78% | 56% | 57% | 32% | 89% | 43% | 46% | 9% |
Die Gesamtauswertung zeigt deutliche Unterschiede zwischen den untersuchten Tools und Konvertierungsstrecken. Grundlage der Bewertung ist das gewichtete Punktesystem, bei dem über alle Kapitel hinweg maximal 712 Punkte erreicht werden konnten. Dadurch lassen sich die Ergebnisse nicht nur kapitelweise, sondern auch als Gesamtleistung vergleichen. Das Ranking zeigt, welche Tools über die getesteten Kapitel hinweg ausgewogen arbeiten und welche Werkzeuge nur in einzelnen Bereichen überzeugen.
Mit 637 von 712 Punkten bzw. 89 % erzielt ChatGPT Markdown die höchste Punktzahl mit der für diese Testsuite gewählten Punktegewichtung. In der dokumentierten Konfiguration liegt das Tool damit klar an der Spitze der Auswertung. Besonders auffällig ist, dass ChatGPT Markdown in mehreren zentralen Kapiteln sehr hohe Werte erreicht, etwa bei Überschriften und Dokumentstruktur, Fußnoten, Endnoten, Bildern und Diagrammen sowie Tabellen. Auch mathematische Inhalte werden zuverlässig erfasst und in LaTeX dargestellt. Im untersuchten Testszenario zeigt ChatGPT Markdown damit im Hinblick auf Struktur, Vollständigkeit und semantische Auszeichnung eine sehr starke Gesamtleistung.
Auf dem zweiten Platz folgt Octopus mit 557,53 Punkten bzw. 78 %. Octopus erreicht in vielen Kapiteln des Testszenarios solide bis sehr gute Ergebnisse und zeigt vor allem bei Überschriftenstrukturen, Textauszeichnungen, Bildern und Tabellen eine starke Leistung. Obwohl Octopus zu den klassischen Toolchains zählt, kann das Tool semantische Strukturen sehr gut und stabil erfassen und darstellen. Besonders positiv fällt auf, dass Tabellen in ihrer semantischen Struktur korrekt erfasst und dargestellt werden.
Gemini Markdown erreicht mit 404,25 Punkten bzw. 57 % den dritten Platz im Rahmen dieses Testszenarios. Das Ergebnis zeigt eine im Durchschnitt solide Leistung, die etwas schwächer als bei ChatGPT Markdown und Octopus ausfällt. Das Tool erreicht in den Kapiteln Mehrspaltigkeit, Mehrsprachigkeit, Listen und mathematische Inhalte sehr hohe Werte. In anderen anspruchsvollen Bereichen des Testdokumentes, wie z.B. bei Sonderzeichen, Bildern und Endnoten, sind die Konvertierungsergebnisse hingegen deutlich eingeschränkt.
Die Mistral Document AI erreicht 395,4 Punkte und damit 56 %. Das Ergebnis zeigt eine mittlere Gesamtleistung im Rahmen dieser Testsuite. Das Tool erzielt in den Kapiteln Sonderzeichen, Mehrspaltigkeit, Mehrsprachigkeit und mathematische Inhalte sehr hohe Werte. In besonders strukturrelevanten Bereichen dieses Testszenarios, zum Beispiel bei komplexeren Verweissystemen, bleibt es jedoch hinter den stärkeren Tools zurück.
Gemini XML erreicht 330,8 Punkte bzw. 46 %. Das Tool erzielt sehr hohe Werte im Kapitel Überschriften und Dokumentstruktur. Auch ein Teil der Fußnoten, Literaturverweise und Teile des Literaturverzeichnisses werden semantisch korrekt erfasst und abgebildet, Gemini XML verliert jedoch viel Inhalt. Zahlreiche Teile des Testdokuments wurden nicht konvertiert und fehlen im Datenexport. Dadurch ist die Leistung in einzelnen strukturellen Bereichen zwar stark, die Gesamtbewertung im Rahmen dieses Testszenarios wird durch fehlende Inhalte jedoch deutlich eingeschränkt.
OpenDataLoader kommt im Standardmodus auf 305,15 Punkte bzw. 43 %. Insgesamt zeigt die Auswertung, dass das Tool über die gesamte Testsuite hinweg weniger konstant arbeitet. In bestimmten Bereichen bleiben semantische Strukturen nicht erhalten, sondern werden zu einfachem Plain Text verarbeitet. Dies betrifft unter anderem die Tabellen ohne Rahmenlinien, mathematische Formeln und das Literaturverzeichnis. Zudem kann OpenDataLoader linksläufige Schriften wie Hebräisch und Arabisch in der gewählten Konfiguration nicht korrekt verarbeiten. Vor allem in Bereichen mit komplexeren semantischen Strukturen zeigt das Tool im Standardmodus daher keine starke Leistung.
Poppler/Pandoc erreicht 231,1 Punkte und damit 32 %. Das Tool kann vor allem einfache Inhalte ohne komplexere Strukturen gut verarbeiten. Sobald anspruchsvollere Strukturen auftreten, werden diese häufig nur als Plain Text ausgegeben. Dies ist z.B. besonders bei den verschiedenen Tabellenarten zu beobachten. Auch Bilder werden nicht korrekt verarbeitet. Ähnlich wie der OpenDataLoader (im Standardmodus) kann auch Poppler/Pandoc linksläufige Schriften wie Hebräisch und Arabisch nicht zuverlässig verarbeiten. In Bereichen mit anspruchsvollen semantischen Strukturen zeigt das Tool im Rahmen dieser Testsuite daher ein deutlich eingeschränktes Konvertierungsergebnis.
Das niedrigste Ergebnis erzielt ChatGPT XML in der dokumentierten Konfiguration mit 60,65 Punkten bzw. 9 %. Ein Großteil der Inhalte des Testdokuments wurde nicht konvertiert und fehlt im Datenexport. Da in zahlreichen Kapiteln nur kleine Fragmente des Testdokumentes verarbeitet wurden, ist eine detaillierte Bewertung der verschiedenen Kapitel kaum möglich. Lediglich in einzelnen Bereichen wie z.B. bei der Überschriftenstruktur oder dem Literaturverzeichnis werden überhaupt relevante Punkte erzielt. Im Vergleich zu den anderen Tools zeigt sich damit eine deutlich geringere Eignung dieser Konfiguration für die untersuchten Konvertierungsaufgaben.
Auffällig ist zudem, dass die XML-Ausgaben von ChatGPT und Gemini nicht valide waren. Bei ChatGPT kommt erschwerend hinzu, dass die erzeugte XML-Datei nicht einmal wohlgeformt war. Damit konnte sie nicht zuverlässig als XML verarbeitet oder gegen ein Schema validiert werden. Gemini erzeugte zwar eine XML-Struktur, diese erfüllte jedoch ebenfalls nicht die Anforderungen an valide XML-Daten. Für den praktischen Einsatz ist dieser Befund besonders relevant, da fehlerhafte oder nicht valide XML-Dateien in automatisierten Workflows zu Abbrüchen, Nachbearbeitungsaufwand und unsicheren Folgeprozessen führen können. Gerade für produktive XML-Pipelines, RAG-Systeme oder verlagsnahe Publikationsprozesse reicht eine inhaltlich plausible Ausgabe daher nicht aus. Entscheidend ist, dass die erzeugten Dateien auch technisch korrekt, prüfbar, wohlgeformt und valide sind.
Insgesamt wird deutlich, dass ChatGPT Markdown in diesem Testszenario die ausgewogenste und leistungsfähigste Gesamtlösung darstellt. Während Octopus besonders stabil über viele Kapitel hinweg abschneidet, zeigen Gemini Markdown, die Mistral Document AI und Gemini XML jeweils spezifische Stärken in bestimmten Bereichen. OpenDataLoader liefert brauchbare, aber weniger konstante Ergebnisse. Poppler/Pandoc und ChatGPT XML fallen im Gesamtvergleich deutlich ab.
Die Ergebnisse der Testkonfigurationen im Überblick:
- ChatGPT Markdown: 637 Punkte bzw. 89 %
- Octopus EXHTML: 557,53 Punkte bzw. 78 %
- Gemini Markdown: 404,25 Punkte bzw. 57 %
- Mistral Document AI: 395,4 Punkte bzw. 56 %
- Gemini XML: 330,8 Punkte bzw. 46 %
- OpenDataLoader im Standardmodus: 305,15 Punkte bzw. 43 %
- Poppler/Pandoc: 231,1 Punkte bzw. 32 %
- ChatGPT XML: 60,65 Punkte bzw. 9 %







