Die technische Architektur hinter dem QBK XML Differ

Diese Seite richtet sich an Entwickler, XML-Spezialisten und technische Projektverantwortliche. Hier werden die im bereitgestellten Differ-Projekt vorhandenen Module und eingesetzen Technologien vorgestellt.

Modulare Matcher-Architektur

Im Projekt finden sich unter anderem Module für identische Inhalte, IDs, Geschwisterbeziehungen, Titel, Sections, Tabellen, Absatzähnlichkeit, Inline-Inhalte und Attribute.

Matcher Framework und API

Ein eigenes Framework steuert die Matching-Schritte. Eine Matcher-API verwaltet Beziehungen zwischen Knoten und stellt bereits erkannte Zuordnungen für weitere Schritte bereit.

Textähnlichkeit und Stemming

Für geänderte Absätze enthält das Projekt einen para-similarity-matcher sowie Hilfsmodule für String- beziehungsweise Wortdistanz und deutsches Stemming.

Myers Diff

Eine Implementierung des Myers-Diff-Verfahrens ist als eigener technischer Baustein enthalten.

Inline- und Attribut-Matching

Für feinere Unterschiede innerhalb bereits zugeordneter Inhalte sowie für XML-Attribute existieren eigene Module.

Edit Script und Validierung

Das Edit Script besitzt eine eigene Schema-Ebene mit RELAX NG Compact und Schematron. Außerdem enthält das Projekt eine Patcher-Komponente.

Tests

Zum Projekt gehören Unit-Tests und XSpec-Tests für zentrale Bestandteile wie Myers Diff, Inline Matching, Matcher API und Side-by-Side-Transformation.

Technologien

Im Differ-Projekt kommen unter anderem zum Einsatz:

  • XML
  • XQuery 3
  • BaseX 12.3
  • XSLT
  • Saxon HE 12.9
  • RELAX NG
  • Schematron
  • Apache Ant

Der QBK XML Differ für Ihre Dokumente

Für ein technisches Review können wir die Matcher-Pipeline gemeinsam an einem repräsentativen Dokumentpaar durchgehen.

>> Kontakt aufnehmen

<< zurück

                                                                                           vor >>