Die technische Architektur hinter dem QBK XML Differ
Diese Seite richtet sich an Entwickler, XML-Spezialisten und technische Projektverantwortliche. Hier werden die im bereitgestellten Differ-Projekt vorhandenen Module und eingesetzen Technologien vorgestellt.
Modulare Matcher-Architektur
Im Projekt finden sich unter anderem Module für identische Inhalte, IDs, Geschwisterbeziehungen, Titel, Sections, Tabellen, Absatzähnlichkeit, Inline-Inhalte und Attribute.
Matcher Framework und API
Ein eigenes Framework steuert die Matching-Schritte. Eine Matcher-API verwaltet Beziehungen zwischen Knoten und stellt bereits erkannte Zuordnungen für weitere Schritte bereit.
Textähnlichkeit und Stemming
Für geänderte Absätze enthält das Projekt einen para-similarity-matcher sowie Hilfsmodule für String- beziehungsweise Wortdistanz und deutsches Stemming.
Myers Diff
Eine Implementierung des Myers-Diff-Verfahrens ist als eigener technischer Baustein enthalten.
Inline- und Attribut-Matching
Für feinere Unterschiede innerhalb bereits zugeordneter Inhalte sowie für XML-Attribute existieren eigene Module.
Edit Script und Validierung
Das Edit Script besitzt eine eigene Schema-Ebene mit RELAX NG Compact und Schematron. Außerdem enthält das Projekt eine Patcher-Komponente.
Tests
Zum Projekt gehören Unit-Tests und XSpec-Tests für zentrale Bestandteile wie Myers Diff, Inline Matching, Matcher API und Side-by-Side-Transformation.
Technologien
Im Differ-Projekt kommen unter anderem zum Einsatz:
Der QBK XML Differ für Ihre Dokumente
Für ein technisches Review können wir die Matcher-Pipeline gemeinsam an einem repräsentativen Dokumentpaar durchgehen.







