KI & intelligente Systeme

KI-Agenten sind keine normale Software.

Gleiche Eingabe, andere Ausgabe. Sie verallgemeinern über ihre Spezifikation hinaus — das ist die Fähigkeit und der Fehlermodus. Sie produktionsreif zu machen, verlangt eine andere Disziplin und eine andere Toolchain.

Beides ist unsere Arbeit.

Oder sehen Sie es in Aktion: den kostenlosen AI Opportunity Scan starten. Unter zwei Minuten. Eine URL.

Eine andere Art von Software

Korrektheit ist nicht mehr binär.

Nahezu jede Engineering-Praxis, auf die sich Ihr Team stützt, setzt voraus, dass Korrektheit ein Zustand ist: Der Code ist richtig oder falsch, und ein Test sagt Ihnen, was zutrifft. Maschinell gelernte Systeme funktionieren so nicht. Korrektheit ist eine Verteilung — eine False-Positive-Rate ist eine Eigenschaft des Systems, kein Defekt darin. Generative Agenten treiben das am weitesten: Sie sind von Natur aus nicht deterministisch, dieselbe Eingabe liefert also nicht verlässlich zweimal dasselbe Ergebnis.

01 · Was Sie gewinnen

Verhalten jenseits der Spezifikation.

Deterministische Software bearbeitet die Fälle, die jemand aufgezählt hat. Ein Agent bearbeitet die, die niemand aufgeschrieben hat — unbekannte Dokumentlayouts, unerwartete Formulierungen, den langen Schwanz, für den früher eine unwartbare Regel-Engine nötig war. Bisher nicht spezifizierbare Probleme wurden lösbar. Genau deshalb setzt man einen Agenten ein.

02 · Was Sie in Kauf nehmen

Dieselbe Eigenschaft, umgekehrt.

Ein System, das über seine Spezifikation hinaus verallgemeinert, handelt manchmal auch außerhalb davon — und es scheitert anders. Klassische Software scheitert laut: eine Exception, ein 500er, ein roter Build. Ein Agent scheitert plausibel — wohlgeformt, selbstbewusst, falsch, ohne dass irgendetwas Alarm schlägt. Er kann in drei von hundert Läufen scheitern, ist also nicht auf Kommando reproduzierbar, und das Beheben ist keine Codekorrektur, sondern eine Verschiebung der Verteilung. Deshalb ist eine Regressionssuite Infrastruktur und keine Kür.

03 · Was sich ohne Ihr Zutun ändert

Der Boden verschiebt sich.

Bei einem gehosteten Modell liefert Ihr Anbieter ein Update aus und das Verhalten ändert sich — ohne Deploy, ohne Commit, ohne Ticket. Bei eigenen Gewichten hält das Modell still, die Welt aber nicht: Eingabeverteilungen driften, und die Genauigkeit vom letzten Quartal lässt nach, ohne dass sich in Ihrem Stack etwas geändert hätte. Deshalb ist eine Regressionssuite Infrastruktur und keine Kür.

04 · Was die Angriffsfläche wird

Daten, die handeln können.

Anderswo sind Daten Daten und Anweisungen Anweisungen. In einem Agenten kann alles, was ins Kontextfenster gelangt — ein Dokument, eine E-Mail, eine Tool-Antwort — wie eine Anweisung wirken. Prompt Injection ist keine Unterart der Eingabevalidierung; Ihr Security-Review hat dafür kein Feld. Agentenspezifisch — die eine Eigenschaft hier, der ein Vision- oder Tabellen-ML-System entgeht.

Eine Verteilung lässt sich nicht unit-testen.

Vertrauen entsteht durch Evaluation gegen kuratierte Datensätze, Bewertung echter Produktions-Traces und Regressionsgates, die bei jedem Modellwechsel laufen — nicht durch Coverage-Prozente. Andere Software, andere Fehler, andere Werkzeuge.

Fehlermodus 01 · 0 Prüfungen

Kein Eval-Harness.

Jede Prompt-Änderung, jedes Modell-Upgrade, jeder neue Dokumenttyp ist ein Ratespiel. Ohne Regressions-Evals kann niemand sagen, ob der Fix von gestern die Fälle vom letzten Monat kaputt gemacht hat — also friert man Änderungen ein, und der Prototyp versteinert.

Fehlermodus 02 · 1 Schritt · 5 Aufgaben

Der monolithische Agent.

Ein Prompt, der fünf Aufgaben erledigt. Er demonstriert sich glänzend und debuggt sich miserabel: Sinkt die Ausgabequalität, lässt sich nicht isolieren, welche Verantwortlichkeit versagt hat. Nicht debugbare Systeme schaffen es nicht in die Produktion.

Fehlermodus 03 · Genauigkeit ↓ bei Volumen

Kontextkollaps bei echtem Volumen.

Der Prototyp lief auf fünfzig handverlesenen Dokumenten. Produktion heißt Hunderttausende — fehlerhaft, doppelt, widersprüchlich. Retrieval verschlechtert sich, Memory-Strategien, die in der Demo funktionierten, brechen ein, und die Genauigkeit rutscht still ab.

Fehlermodus 04 · Kosten ↑ kumulierend

Die Kostenkurve, die niemand modelliert hat.

Token-Kosten, die pro Anfrage vernachlässigbar wirkten, summieren sich über Retries, Agenten-Schleifen und Skalierung. Projekte sterben im Büro des CFO genauso oft wie im Repository.

Fehlermodus 05 · kein Rückweg

Keine Notausstiege.

Kein Rollback-Pfad, keine Eskalation an Menschen, kein Audit-Trail. In dem Moment, in dem das System einen teuren Fehler ohne Wiederherstellungsgeschichte macht, verdampft Vertrauen — und Vertrauen kommt nicht zu Prototyp-Preisen zurück.

Warum Prototypen sterben

Die Lücke hat eine Anatomie.

Nicht-Determinismus ist die Ursache. Dies sind die Symptome. Jedes ins Stocken geratene KI-Projekt, zu dem wir gerufen wurden, ist auf eine von wenigen vorhersehbaren Arten gescheitert — an Engineering, nicht an Strategie.

Fehlersignatur0 Prüfungen
erfassen
klassifizieren
extrahieren
entscheiden
übernehmen
keine Prüfung
keine Prüfung
keine Prüfung
keine Prüfung
keine Prüfung
jeder Schritt läuft, keiner wird verifiziert — ändern Sie einen und Sie erkennen nicht, was sich bewegt hat

Eine Pipeline · fünf Arten zu scheitern

Wie ein Projekt beginnt

Zwei Fragen, beantwortet in Artefakten.

Ihr Problem
01 · Bewerten
02 · Entwerfen
Bau beginnt →
Acht Ergebnisse · weiterscrollen oder eines auswählen

Bevor eine der vier Praktiken beginnt, werden beide in lauffähigem Code und schriftlichen Verträgen geklärt — nicht in Folien. Sie behalten alles davon, ob wir das System bauen oder nicht.

01 · Bewertenlohnt sich der Bau überhaupt?
01
Machbarkeits-SpikeLauffähiger Code auf Ihren echten Daten, keine Folie, die Machbarkeit behauptet.
Was es Ihnen sagtWie genau es heute ist, gemessen an Ihren Dokumenten statt an einem Benchmark.Welche Fälle es sauber löst und welche weiterhin einen Menschen brauchen.Was zutreffen muss, damit das Gesamtsystem in der Produktion trägt.
Lauffähige SoftwareDie Entscheidung, die es klärtOb sich der Bau überhaupt lohnt.
02
KI-PotenzialkarteWo KI in Ihren tatsächlichen Abläufen Hebelwirkung erzeugt.
Was es Ihnen sagtDie zwei oder drei Stellen, die sich zuerst zu automatisieren lohnen, und warum.Die, die attraktiv aussehen, den Aufwand aber nicht zurückzahlen.Was jede davon pro Monat an Stunden oder Ausgaben wert ist.
Schriftliches ErgebnisDie Entscheidung, die es klärtWo anfangen und was vorerst liegen bleibt.
03
Daten-RealitätscheckWas Ihre Daten heute tragen — und was vorher angereichert werden muss.
Was es Ihnen sagtWelche Quellen so nutzbar sind, wie sie sind.Wo Lücken, Dubletten und fehlende Historie liegen.Wie viel Vorbereitung nötig ist, bevor Ergebnisse belastbar sind.
Schriftliches ErgebnisDie Entscheidung, die es klärtOb die Daten den Plan tragen — oder der Plan sich ändert.
04
KostenmodellPrognostizierte Inferenz- und Infrastrukturökonomie bei Ihren Volumen.
Was es Ihnen sagtKosten pro Dokument, Anfrage oder Transaktion beim heutigen Volumen.Wie das skaliert, inklusive der Retries, die die meisten Schätzungen ignorieren.Günstigere Alternativen und worauf jede davon verzichtet.
FinanzmodellDie Entscheidung, die es klärtOb die Wirtschaftlichkeit im Maßstab trägt, nicht nur im Pilotprojekt.
02 · Entwerfenwas genau ist das System?
05
Agenten-TopologieWelche Verantwortlichkeiten Agenten sind, welche deterministischer Code, und wie sie zusammenspielen.
Was es Ihnen sagtWelche Schritte wirklich ein Modell brauchen — meist weniger als erwartet.Welche Schritte konventionelle Software bleiben, damit sie vorhersehbar und günstig bleiben.Wo die Arbeit so geteilt ist, dass ein Fehler auf eine Stelle zurückführbar bleibt.
ArchitekturDie Entscheidung, die es klärtWas wir bauen — präzise genug, um es zu schätzen.
06
Datenfluss- & IntegrationsvertragWie das System an Ihr ERP, CRM, Messaging und Ihre Datenspeicher andockt.
Was es Ihnen sagtWelche Daten genau jede Grenze passieren, und in welcher Richtung.Was passiert, wenn ein System langsam ist, ausfällt oder dasselbe zweimal schickt.Was Ihr Team verantwortet und was wir verantworten.
IntegrationsplanDie Entscheidung, die es klärtWie das in Ihren Stack passt, ohne dass eine Seite die andere blockiert.
07
Eval-PlanDie Testsuite, die künftig jede Änderung absichert — entworfen, bevor der Bau beginnt.
Was es Ihnen sagtWas „gut genug zum Ausliefern“ heißt, als Zahl, auf die sich alle einigen.Wie ein Modell- oder Anbieter-Update auffällt, bevor Ihre Nutzer es merken.Wie Produktionsprobleme zu dauerhaften Tests werden statt zu wiederkehrenden.
QualitätsplanDie Entscheidung, die es klärtWoran Sie in sechs Monaten erkennen, dass es noch funktioniert.
08
Guardrail- & Prüfpunkt-DesignWo das System nachfragen, eskalieren oder stoppen muss.
Was es Ihnen sagtWelche Entscheidungen an einen Menschen gehen, und ab welcher Konfidenz.Was niemals ungeprüft in ein Geschäftssystem geschrieben werden darf.Was passiert, wenn etwas schiefgeht: eskalieren, zurückrollen oder anhalten.
Risiko & KontrollenDie Entscheidung, die es klärtWie viel Autonomie das System am ersten Tag bekommt.

Die meisten Projekte starten mit einer Zwei-Minuten-Version des ersten Gates. Ihren AI Opportunity Scan kostenlos starten →

Vier Praktiken, keine vier Schritte. Die vierte ist der Grund, warum die ersten drei gültig bleiben.

Multi-Agenten-KI-Systeme

Bauen

Orchestrierte Agentensysteme mit den Guardrails, dem Monitoring und der Kostendisziplin, die unbeaufsichtigten Betrieb erlauben.

Sie kommen mit

Ein funktionierendes Notebook, ein Pilot in einem Team oder eine Anbieter-Demo, die bei „beeindruckend“ stehen geblieben ist.

Wir entwickeln

Die Agenten-Topologie — Orchestratoren, spezialisierte Agenten, deterministische Schritte dort, wo Determinismus gewinnt — mit Tool-Nutzung, Memory, menschlichen Prüfpunkten und Tracing, von Anfang an mitgedacht.

Sie gehen mit

Ein ausgeliefertes System, seine Eval-Suite, seine Traces und die Dokumentation, die Ihr Team zum Weiterbauen braucht.

Eine Abwägung, die wir treffen

Wann ein monolithischer Agent in einen Orchestrator mit Spezialisten aufzuteilen ist — und wann nicht. Ist der Ablauf fest, schlägt deterministischer Code jeden Agenten; Agenten verdienen ihren Platz nur dort, wo Routing und Schlussfolgern wirklich dynamisch sind. Die meisten ins Stocken geratenen Projekte haben diese Grenze in die eine oder andere Richtung falsch gezogen.

LangChainAWS BedrockFireworks AITavily
Datenanreicherung & ML

Speisen

KI-Systeme sind nur so gut wie die Datenpipelines darunter — und die Pipeline ist meist das eigentliche Projekt.

Sie kommen mit

Daten verstreut über ein ERP, Tabellen, PDFs und einen Sensordatenstrom, den niemand ansieht; oder ein RAG-Prototyp, der selbstbewusst und falsch antwortet.

Wir entwickeln

Automatisierte Anreicherungs- und ML-Pipelines — Ihre Daten bereinigen, verbinden und aktivieren, damit Modelle auf belastbaren Fakten arbeiten, mit geplanten Workflows, die das so halten. Dazu gehören auch die Eval-Daten des Systems: kuratierte Beispiele, gelabelte Fehler-Traces und Golden Datasets sind ebenfalls Data Engineering — und genau die Datensätze, die die meisten Teams zu bauen vergessen.

Sie gehen mit

Produktive Pipelines, dokumentierte Datenverträge und Retraining-/Refresh-Workflows, die Ihr Team selbst betreiben kann.

Eine Abwägung, die wir treffen

Wann nachgelagert angereichert und wann an der Quelle korrigiert wird. Anreicherungs-Pipelines können einen kaputten vorgelagerten Prozess eine Weile überdecken — aber wenn das Quellsystem weiter Unbrauchbares produziert, sagen wir Ihnen, die Quelle zu reparieren, auch wenn die Pipeline die größere Rechnung wäre.

LangGraphKestraAWS SageMakerAWS Glue
Cloud, Edge & Modellplatzierung

Ausrollen

Dort ausliefern, wo die Daten leben, auf dem Modell, das passt — AWS-Cloud, wenn es geht, Fertigungshalle, wenn es sein muss, eigene Gewichte, wenn Ökonomie oder Datenschutz es verlangen.

Sie kommen mit

Ein System, das in einer Umgebung funktioniert, und Anforderungen, die es dort nicht erfüllen kann — Latenz, Konnektivität, Datenresidenz oder Stückkosten. Oder eine Frontier-API-Rechnung, die bei Produktionsvolumen keinen Sinn mehr ergab.

Wir entwickeln

Produktives Deployment auf AWS oder Edge-Inferenz dort, wo die Daten entstehen — Fertigungshallen, Fahrzeuge, abgelegene Standorte — mit Offline-Resilienz, wenn das Netz ein Vielleicht ist. Und die Modellentscheidung darunter: Frontier-API, Open-Weight-Modell, feinabgestimmt oder quantisiert für die Zielhardware.

Sie gehen mit

Infrastructure as Code, Deployment-Pipelines, eine dokumentierte Entscheidung zur Modellherkunft samt Kosten- und Qualitätsabwägungen und eine Edge-Flotte, die Ihr Team aus der Ferne aktualisieren kann.

Eine Abwägung, die wir treffen

Cloud, Edge oder eigenes Modell ist eine Entscheidung über Ökonomie und Physik, keine Vorliebe. Wir modellieren Latenzbudgets, die reale Konnektivität, Datengravitation und Kosten pro Inferenz bei Ihren Volumen. Manchmal schlägt ein feinabgestimmtes kleines Modell auf Ihrer eigenen Hardware die Frontier-API auf jeder Achse, die Ihnen wichtig ist — außer der im Benchmark-Diagramm.

AWS GreengrassAWS SageMaker EdgeLambdasAWS Kinesis
Evals, Observability & PerformanceDer Rückweg

Überwachen

Das ausgelieferte System ist eine Hypothese. Monitoring macht daraus eine Tatsache — und hält sie so.

Sie kommen mit

Ein System in Produktion, von dem niemand belegen kann, dass es funktioniert. Qualität misst sich in Beschwerdevolumen, „es fühlt sich seit dem Modell-Update schlechter an“ ist nicht widerlegbar, und niemand kann sagen, was eine Anfrage kostet oder wie viel langsamer sie letzten Monat wurde.

Wir entwickeln

Das Eval-Harness und die Observability-Schicht. Offline-Regressionssuiten, die jedes Release absichern; Online-Evals, die echte Produktions-Traces dort bewerten, wo es keine Referenzantwort gibt; verteiltes Tracing über jeden Agentenschritt und Tool-Aufruf; Latenz- und Token-Kostenbudgets, gemessen pro Workflow-Schritt statt geschätzt. Und die Schleife, die das verbindet — ein Produktionsfehler wird zu einem benannten Fehlermodus, dann zu einem Datensatzbeispiel, dann zu dauerhafter Regressionsabdeckung.

Sie gehen mit

Eine Regressionssuite, die mit jedem Vorfall wächst, Dashboards für p50/p95-Latenz und Kosten pro Workflow, die Ihr Team ohne uns liest, Alarmierung auf benannte Fehlermodi statt auf generische Qualitätswerte, und einen schriftlichen Ablauf, um den nächsten Produktionsfehler in einen Test zu verwandeln.

Eine Abwägung, die wir treffen

Welche Fehler einen LLM-Judge verdienen und welche eine deterministische Prüfung brauchen. Judges sind verführerisch, weil sie mit subjektiver Qualität skalieren, aber sie müssen gegen gelabelte Traces kalibriert werden, bevor ihre Werte ein Release absichern dürfen — sonst füllen sie nur ein Dashboard. Alles, was sich als Schema-Prüfung, exakter Abgleich oder Exit-Status ausdrücken lässt, sollte nie einem Modell überlassen werden. Wir liefern lieber fünfzig günstige deterministische Zusicherungen aus als einen beeindruckenden Judge, dem niemand traut.

Auf einer Edge-Flotte ist das noch einmal eine eigene Disziplin — Gerätezustand, Firmware-Stände und Sensordrift auf Hardware, auf die Sie sich nicht per SSH verbinden können.

LangSmithAWS Bedrock AgentCore

Vier Praktiken, ein Kreislauf. Was Überwachen in der Produktion lernt, wird zu dem, was Bauen ändert, was Speisen kuratiert und was Ausrollen als Nächstes ausliefert. Ein System ohne diesen Rückweg ist nicht in Produktion — es ist in freier Wildbahn.

„Könnte unser Team das nicht bauen?“ Mit ziemlicher Sicherheit. Der Bau ist die sichtbare Hälfte — das Harness, die Traces und der Kreislauf sind die Hälfte, die darüber entscheidet, ob es nächstes Jahr noch läuft.

Innenansicht eines Produktivsystems

Was „produktionsreif“ tatsächlich heißt, gezeichnet.

Dieselbe Dokumenten- und Sensor-Pipeline wie auf unserer Startseite — diesmal mit den Teilen, die sie produktionsreif machen: die Eval-Schleife, die Traces, die Prüfpunkte, die Zähler.

Referenzarchitektur · Dokumenten- und Sensor-Pipeline
der Rückweg — Fehler → Datensatzbeispiel → Regressionsabdeckung
Offline-Eval-Gate— nichts wird gemergt, bevor die Suite besteht; was die Produktion gelernt hat, entscheidet also über das Nächste
Dokumente
Sensoren
erfassen
Orchestrator
Klassifikator
Extraktor
Validator
menschliche Prüfung
erp
TracingKostenerfassungOnline-Evals
Dieselbe Pipeline, hochkantAuf eine Markierung tippen
Rückweg
Offline-Eval-Gatenichts wird gemergt, bevor die Suite besteht
Dokumente
Sensoren
erfassenEingabevalidierung am Eingang
Orchestrator
Klassifikator
Extraktor
Validator
menschliche PrüfungAusgaben mit geringer Konfidenz und hohem Einsatz landen hier
erpein versioniertes Schema, niemals ein unvalidierter Schreibzugriff
Telemetrie-Bus · jeder Schritt hängt sich ein
TracingOnline-EvalsKostenerfassung

Offline-Eval-Gate — jede Ausgabeklasse hat eine Regressionssuite kuratierter Beispiele; Änderungen an Prompts oder Modellen werden erst gemergt, wenn die Suite besteht.

Online-Evals — Produktions-Traces werden laufend gegen Qualitäts- und Policy-Signale bewertet, ohne Referenzantwort als Stütze; das Live-Gegenstück zum Offline-Gate.

Tracing — jede Agentenentscheidung erzeugt einen Trace; geht etwas schief, steht die Antwort im Trace und nicht in einem Krisenmeeting.

Der Rückweg — ein Trace, der einen Fehler offenlegt, wird zu einem benannten Fehlermodus, dann zu einem Datensatzbeispiel, dann zu dauerhafter Regressionsabdeckung; dieser Pfeil macht aus dem Diagramm eine Schleife statt einer Pipeline.

Menschlicher Prüfpunkt — Ausgaben mit geringer Konfidenz und hohem Einsatz gehen in die Prüfung; die Schwelle ist ein justierter Parameter, keine Hoffnung.

Kostenerfassung — Ausgaben werden pro Workflow-Schritt erfasst; Retries und Agenten-Schleifen sind budgetiert, nicht überraschend entdeckt.

Guardrails an den Grenzen — Eingabevalidierung am Eingang, Ausgabeverträge am Ausgang; das ERP erhält nie einen unvalidierten Schreibzugriff.

Integrationsvertrag — die ERP-Grenze ist ein versioniertes Schema, damit sich KI-System und Geschäftssystem unabhängig weiterentwickeln können.

Wo die andere Säule andockt

KI braucht Daten. Daten brauchen Sensoren. Sensoren brauchen Hardware.

Wenn die Daten, die Ihre Modelle brauchen, noch gar nicht existieren — weil sie in einer Fertigungshalle, in einer Maschine oder am fernen Ende eines unzuverlässigen Netzes entstehen — ist es kein Softwareproblem mehr. Unser Hardware- und IoT-Bereich entwickelt die Hardware, die diese Daten erzeugt: eigene Leiterplatten, HF-vermessene Funkmodule, Energiebudgets im Mikroampere-Bereich. Ein Team, beide Enden der Pipeline.

Unsere Laborkapazitäten entdecken →

Bereit, wenn Sie es sind

Sehen Sie die Disziplin, bevor Sie sie kaufen.

Der AI Opportunity Scan ist selbst ein produktives agentisches System — gebaut mit derselben Eval-, Tracing- und Guardrail-Disziplin, die auf dieser Seite beschrieben ist. Lassen Sie ihn über die URL Ihres Unternehmens laufen und erhalten Sie Ihre KI-Potenzialkarte und Ihren Wettbewerbsabstand. Unter zwei Minuten. Eine URL.