NLP- & LLM-Engineering
Assistenten, die aus Ihren eigenen Dokumenten antworten, Datenextraktion, Chat und Automatisierung, so gebaut, dass Qualität gemessen wird, bevor etwas Nutzer erreicht.
Sprachsysteme, die standhalten
Die meisten Sprachmodell-Demos entstehen an einem Wochenende. Die eigentliche Arbeit ist, sie verlässlich genug für Kunden und Auditoren zu machen: sicherzustellen, dass jede Antwort aus Ihren eigenen Quellen kommt statt aus der Fantasie des Modells, die Dokumente zu verkraften, an denen Parser scheitern, und Qualität Release für Release zu belegen. Assistenten, Abruf-Pipelines (das Muster, das üblicherweise RAG heißt), Extraktion, Chat und Automatisierung bauen wir von Tag eins mit dieser Messlatte.
Wir liefern evaluation-first. Bevor wir Prompts justieren oder ein Modell wählen, bauen wir ein Testset aus Ihren echten Dokumenten und Fragen, mit Kriterien, die Sie abnehmen. Jede Änderung wird daran gemessen, sodass Halluzinationsrate, Extraktionsgenauigkeit und Latenz Zahlen auf einem Dashboard sind, keine Eindrücke aus einer Demo.
Am Ende steht ein System, das Ihr Team gefahrlos ändern kann: das Modell tauschen, wenn ein besseres erscheint, Prompts anpassen, den Korpus erweitern, und die Eval-Suite sagt in Minuten, ob die Qualität gehalten hat. Kosten werden pro Anfrage erfasst, sodass die Skalierungsentscheidung mit Preisschild kommt, nicht mit einer Überraschungsrechnung.
Was evaluation-first bringt
Verankerte Antworten
Antworten aus Ihren eigenen Quellen, mit Verweis auf jede einzelne, sodass jede Antwort prüfbar ist und die Rate erfundener Antworten gemessen wird, nicht geschätzt.
Evaluation vor dem Launch
Ein Testset aus Ihren echten Daten prüft jedes Release. Fällt die Qualität, stoppt das Deployment.
Modellunabhängigkeit
OpenAI, Anthropic oder offene Gewichte hinter einer Schnittstelle. Erscheint ein besseres oder günstigeres Modell, ist der Wechsel eine Konfiguration plus ein Eval-Lauf.
Kosten pro Anfrage, bekannt
Token-Ausgaben werden pro Feature und pro Kunde erfasst, mit Caching und Routing, damit die Rechnung zur Wertschöpfung passt.
Strukturierte Ausgaben zum Weiterbauen
Extraktion liefert typisiertes, validiertes JSON, das Ihre Systeme direkt verarbeiten, mit Konfidenzwerten für Review-Queues.
Vom Eval-Set in die Produktion
Eval-Set aufbauen
Wir sammeln echte Dokumente, Fragen und Grenzfälle aus Ihrer Domäne und definieren Bestehenskriterien mit Ihren Fachleuten.
Dagegen prototypisieren
Erste funktionierende Pipeline in Tagen: Retrieval, Prompts und Modellwahl iteriert am Eval-Set, nicht an Meinungen.
Für Produktion härten
Grenzen für das, was das System ausgeben darf, Fallbacks, Limits, strukturierte Logs und Kostenkontrolle rund um den Happy Path.
Ausliefern und überwachen
Live-Qualitätsstichproben, Drift-Alerts auf Eingaben und eine Feedback-Schleife, die Nutzerkorrekturen zu Eval-Fällen macht.
Was Sie bekommen
Antworten auf Ihre Fragen
Welches Modell setzen Sie ein?
Das, das Ihr Eval-Set zu den niedrigsten Kosten besteht. Wir benchmarken OpenAI, Anthropic und Modelle mit offenen Gewichten auf Ihren echten Aufgaben, und die Architektur hält die Wahl umkehrbar.
Wie gehen Sie mit vertraulichen Dokumenten um?
Ihre Daten bleiben in Ihrer Cloud oder auf EU-gehosteten Endpoints, ohne Training auf Ihren Eingaben. Wo Richtlinien es verlangen, deployen wir Modelle mit offenen Gewichten vollständig in Ihrer Infrastruktur.
Und Halluzinationen vor Kunden?
Antworten stammen aus Ihren Inhalten statt aus dem Gedächtnis des Modells, Zitate machen sie prüfbar, und eine Grenzschicht fängt Ausgaben ab, die Ihre Regeln verletzen. Wir messen an einem festen Testset, wie oft das System etwas erfindet, und machen diese Zahl zum Freigabekriterium.
Dokumente oder Gespräche, die arbeiten sollen?
Bringen Sie drei echte Beispiele in ein Gespräch mit, und wir skizzieren Pipeline und Eval-Plan.
Mit einem Engineer sprechen