Plattform
Ihre eigenen Dokumente
Formate. PDF mit Textebene, DOCX, ältere DOC-Dateien (über eine Konvertierung im Hintergrund), TXT, Markdown und einfaches HTML. Andere Formate werden abgewiesen, nicht stillschweigend übersprungen. Eine Texterkennung für gescannte Dokumente ist nicht enthalten: reine Bild-PDFs ergeben leere Seiten.
Zerlegung, die der Struktur folgt. Kasimir zerlegt nicht in gleich lange Blöcke, sondern entlang der Gliederung:
- Elternabschnitt je § beziehungsweise Art., bei Verträgen je nummerierter Hauptklausel. Er ist der Kontext, der später der Generierung übergeben wird, und wird nie allein indexiert.
- Kindpassagen als Satzfenster von höchstens 512 Token mit 64 Token Überlappung. Sie sind das, was gesucht wird. Die Obergrenze ist keine Willkür: sie entspricht der Eingabegrenze des Neubewertungsmodells.
- Regel: nie mitten im Satz trennen, nie über eine §- oder Art.-Grenze hinweg. Nur ein Abschnitt, der für sich genommen zu lang ist, wird in mehrere seitenbezogene Elternabschnitte aufgeteilt.
- Dokument, Seite, Abschnittsbezeichnung und Abschnittspfad werden bis auf die Kindebene durchgereicht. Deshalb ist eine Quellenkarte vollständig, ohne dass das Originaldokument erneut geöffnet werden muss.
Die Satzgrenzenerkennung arbeitet mit einem deutschen Sprachmodell für Satzsegmentierung, nicht mit einer Punkt-Heuristik. Das ist bei „§ 6 Abs. 1 lit. a" der Unterschied zwischen einem und vier Sätzen.
Umgang mit personenbezogenen Daten. Vor jedem Aufruf des Sprachmodells werden zwei Schichten angewandt:
- Regelbasiert: österreichische Sozialversicherungsnummern (mit Plausibilitätsprüfung des Geburtsdatums), IBAN, E-Mail-Adressen und österreichische Telefonnummern mit ausdrücklicher Landesvorwahl. Jeder Treffer wird durch eine bedeutungsfreie Kennung ersetzt; derselbe Wert erhält stets dieselbe Kennung, damit Bezüge im Text erhalten bleiben.
- Namenserkennung: Personennamen und Ortsangaben werden ebenfalls ersetzt. Organisationen bewusst nicht — Gerichts- und Kanzleibezeichnungen sind öffentlich und für die Antwortqualität wesentlich.
Die Rückersetzung erfolgt anfragebezogen, bevor Sie die Antwort sehen. Im laufenden Stream werden angebrochene Kennungen zurückgehalten, damit nie eine halbe Ersetzung auf dem Bildschirm erscheint. In den Betriebsprotokollen stehen in der Produktionskonfiguration keine Dokument- oder Antworttexte, sondern ein Hashwert und die Länge.
Die Grenzen dieser Ersetzung, offen benannt:
- Sie greift an der Schnittstelle zum Sprachmodell. Der Einbettungsaufruf, der Dokumente überhaupt durchsuchbar macht, ist heute nicht davon erfasst. Solange dieser Dienst nicht in Ihrer eigenen Umgebung läuft, verlässt der Rohtext Ihrer Dokumente die Instanz auf diesem Weg. Wir halten das für den wichtigsten offenen Punkt und besprechen ihn in jedem Projekt zuerst — die Architektur ist darauf ausgelegt, den Einbettungsdienst zu verlagern.
- Das eingesetzte Namenserkennungsmodell ist die kompakte deutsche Variante. Die Erkennung ist bestmöglich, nicht vollständig. Ein nicht erkannter Name wird nicht ersetzt.
- Nicht ersetzt werden unter anderem: Aktenzahlen, Firmenbuchnummern, UID-Nummern, Geburtsdaten ohne Sozialversicherungsbezug, Vertragsbeträge und Kontobezüge.
Kasimir ersetzt keine anwaltliche Prüfung.
Offene Fragen? Dreißig Minuten genügen.
Wir gehen die Verarbeitungsorte durch und zeigen die Recherche an einem Fall aus Ihrem Rechtsgebiet.