(essence-extractor-engine) Das Sentrax-System besitzt mehrere unterschiedliche Such- und Analyse Funktionen. In dieser Online-Version werden speziell die Lexico-Suche, die Context-Suche, die Treffer-Fundstellen gezeigt.

mehr erfahren...

Demo

Suchcontainer

Euro-Parl-V7

European Parliament Proceedings Parallel Corpus 1996 - 2011

Gesamt: 1921 Artikel

Die Trax-Engine und ihre Vorteile... sind Ihr Vorteil!


Eine Suche in Dokumenten kann sich aus verschiedenen Gründen als mühsam erweisen: Es ist nicht genau bekannt, welche Ausdrucksweise verwendet wurde, welche Schreibregeln verfolgt wurden und ob nicht die Suchbegriffe überhaupt korrekt geschrieben sind. Manchmal weiß man selbst nicht, ob man besser (zB.) Potenzial oder Potential eingeben soll. Und, wenn auch fremdsprachliche Einsprengsel vorhanden sein können, erhöht sich die Problematik nochmal: Besser nach Adresse oder address suchen, besser Apartment oder Appartement eingeben? Und wie war der Eigenname noch: Chebychev oder Tschebyscheff? Kann man sicher sein, das zugehörige Formular zu Fahrkosten auch zu finden, wenn man Fahrtkosten eingibt? Und weiteres mehr.

Unsere Suchengine SenTrax erlaubt ein interaktives Navigieren in den Dokumenten nach ganz verschiedenen Kriterien: Einmal bietet sie mit "lexico" eine fuzzy Textsuche an; die Eingabe kann auch aus mehreren Wörtern oder einem ganzen Satz bestehen: Falls es ihn im Bestand gibt wird er sofort gefunden; falls es ihn nicht gibt, bietet das System eine Liste ähnlicher Kandidaten an. So hilft auch ein nur ungefähres Erinnern dennoch ans Ziel zu kommen.

Eine völlig andere Funktion, "context", zeigt Begriffscluster, die eine Umgebung des Eingabebegriffs darstellen und sich aus dessen diversen Kontexten herausbilden. Diese Cluster lassen sich interaktiv ausweiten (und können mit weiterer Metainformation angereichert werden). Oft enthalten sie Synonyme oder den Wortpartner, der oft beim Suchwort steht (wie zB der Vorname zum Nachnamen).

Die "treffer"-Funktion listet Trefferdokumente auf, die den Begriff (oder mehrere) aus der Suchanfrage enthalten. Hier wird es nochmal spannend, denn die jetzt bereit stehende Funktion "similar" zeigt blitzschnell eine Liste von Kandidatendokumenten, die ähnlich zum dafür ausgewählten Trefferdokument sind. So findet man schnell zB Dubletten oder nahe Dubletten (meist Versionen eines Dokuments, die im Laufe der Entwicklung gesammelt aber nicht bereinigt wurden). Das ursprüngliche Suchwort muss hier nicht enthalten sein.

Weitere Details sowie Beispiele zu den beschriebenen Funktionen sind in den nachfolgenden Blöcken gegeben.

Eigenschaften


Lexikographische Suche

Die Funktion Lexico liefert zur Eingabe lexikografisch verwandte Wörter oder Begriffe. Beispiele wären ‘Uranerzbergbau’ und ‘Uranbergbau’ oder ‘Z4stimm4ng’ und ‘Zustimmung’ oder 'Bankkonto’ und ’Banckonto’ und ’Postbankkonto’ oder ’Apartment' und 'Appartment' und Apartement' und 'Appartement'. Wegen dieser Art Fehlertoleranz werden auch Fragmente oder teilweise Verfremdungen oder tippfehlerbehaftete Objekte aufgefunden. Das Aufzeigen solcher naher Doubletten ist besonders bei Fehlschreibungen von Eigennamen oder Spezialbegriffen wertvoll und funktioniert auch sprachübergreifend, wie etwa bei ’Adresse' und 'Address'. Auch wenn eine Anfrage nicht im Datenbestand vorkommt, antwortet die Maschine mit Kandidaten darin, die lexikografisch ähnlich sind. Als Folge können so in der Praxis auch Mängel in OCR-Dokumenten oder bei automatischer Formularbearbeitung ausgeglichen werden.

Die Eingabe kann auch aus einem ganzen ’Satz’ bestehen (inklusive eventueller Schreibfehler oder Schreibvarianten), wobei diese dann zu Dokumenten mit den dazu passenden Fundstellen führt. (Bestandteile, die wenig Information beinhalten, wie der-die-das-..., werden mittels einer frei konfigurierbaren Stoppwortliste ausgefiltert und sollten nicht Gegenstand einer Suche sein.)

Kontext Suche

Die Context-Funktion zeigt die engsten, statistisch gemeinsam auftretenden Begriffe in den Datenblättern, bezogen auf die Eingabe. So ruft zB ’Bankkonto’ die Begriffe ’Lastschriftverfahren’ - ’Barbezahlung’ - ’Kleinstbeträge’ - ’Lohnrunde’ auf und z.B. ’Insolvenzen’ die Wörter ’Creditreform’ - ’Pleitenrekord’ - ’Zusammenbrüche’ - ’Jahresvergleich’ - ’Forderungsausfälle’ und z.B. ’Industriespionage’ erinnert an den Vorfall ’Firmengeheimnisse’ - ’Einkaufchef’ - ’Opel-Daten’ - ’derSpanier’, was seinerzeit mehrfach Titelgeschichte war.

Auf diese Weise werden oft interne Zusammenhänge zwischen unterschiedlichen Datenblättern, wie zB Zeitungsartikel, Sicherheitsvorschriften, Protokolle, Verträge, Mails usw. sichtbar gemacht. Verantwortlich ist die dahinterliegende Auswertung von Kookkurrenzen zweiten Grades über alle gelernten Dokumente hinweg. Auch diese Funktion operiert sprachübergreifend.

Ähnliche Dokumente

Die Trefferfunktion holt die Dokumente, in denen der oder die Suchbegriffe vorkommen -egal ob in lexico oder context gezeigt- und belegt so den Nachweis der Antworten. Es kann zB die Suche nach ’Witterungssituation’-’Verbesserung’-’Skibedingungen’ zu genau einem Dokument führen, in dem alle drei Eingabebegriffe auch vorkommen; weitere Trefferstellen enthalten dann eventuell nur noch 2 oder einen der Suchbegriffe. Hierzu kann man sich mit dem Sentrax-System sehr schnell einen Überblick verschaffen und findet somit garantiert die Erklärung für die jeweilige Antwort. Aufgrund des expliziten Memory im Sentrax-System gehört es zu den sogenannten XAI-Modellen: Die assoziative Intelligenz der Sentrax garantiert die Erklärbarkeit ihrer Antworten und zeigt die jeweiligen Quellen auf - auch wenn diese nur auf einem einzigen (vielleicht sogar falsch geschriebenen) Begriff beruhen.