KI-Agenten & LLM-Integration

Sprachmodelle in einem Produkt, das eine Aufgabe hat — kein Chatbot, der an eine Startseite geschraubt wurde.

Der Abstand zwischen einer beeindruckenden Demo und einer Funktion, die täglich genutzt wird, ist fast vollständig Engineering. Ein Modellaufruf ist trivial. Zu wissen, was abgerufen werden muss, wie die Aufgabe begrenzt wird, was zu tun ist, wenn das Modell Unsinn liefert, wie Kosten planbar bleiben und wie Ihre Dokumente aus fremden Trainingsdaten herausbleiben — das ist die Arbeit.

Ich baue LLM-Funktionen in echte Produkte: Assistenten, die aus Ihrem eigenen Material antworten statt aus dem offenen Internet, Retrieval-Pipelines über Ihre eigenen Dokumente — inklusive vollständig selbst gehosteter Modelle, wenn die Daten Ihre Infrastruktur nicht verlassen dürfen — und Agenten-Pipelines, die eine mehrstufige Aufgabe bis zum Ergebnis tragen, statt nur eine Frage zu beantworten und aufzuhören.

Ich habe das in ein Produkt gebaut und nicht in eine Demo — KI-Musikgenerierung in einer Desktop-Anwendung, wo das Interessante nicht das Modell war, sondern alles darum herum: Eine Generierung ist ein Job mit Zuständen und kein Funktionsaufruf; der Abschluss-Callback landet auf einem Server und nicht auf einer App, die eine Verbindung offen hält; und das Ergebnis muss dort ankommen, wo jemand ohnehin schon arbeitet. So sieht der Großteil dieser Arbeit aus.

Was Sie bekommen

Retrieval über Ihre eigenen Inhalte

Ihre Dokumente, Verträge, Kataloge oder Wissensbasis werden beantwortbar — mit Quellenangaben, sodass eine Antwort überprüft und nicht geglaubt werden muss.

Selbst gehostet, wo es zählt

Wenn die Daten die Infrastruktur wirklich nicht verlassen dürfen: offene Modelle auf Ihrer eigenen Hardware. Aufwendiger zu bauen und manchmal die einzig vertretbare Antwort.

Agenten, die eine Aufgabe abschließen

Mehrstufige Pipelines mit Werkzeugen, Prüfpunkten und definiertem Fehlerverhalten. Eine Aufgabe endet in einem Ergebnis oder in einem klaren Fehler — nie in einer selbstbewussten Halluzination, die als erledigt gilt.

Planbare Kosten und Grenzen

Token-Budgets, Caching, Modellauswahl pro Schritt und ein Ausweichpfad, wenn ein Anbieter ausfällt. KI-Funktionen erzeugen eine laufende Rechnung, und die sollte keine Überraschung sein.

Wie es abläuft

  1. 01

    Die lohnende Aufgabe finden

    Meist nicht die, die zuerst vorgeschlagen wird. Die besten Kandidaten sind hochvolumig, vertragen einen Prüfschritt und werden heute von Menschen durch Lesen und Abtippen erledigt.

  2. 02

    Die Bewertung vor der Funktion bauen

    Eine Menge realer Fälle mit bekannt guten Antworten. Ohne sie ist „wirkt jetzt besser“ das einzige Maß, und das ist wertlos.

  3. 03

    Hinter einem Menschen ausliefern

    Die erste Version schlägt vor, ein Mensch bestätigt. Das Vertrauen, diesen Schritt zu streichen, muss aus gemessenen Ergebnissen kommen, nicht aus Annahmen.

  4. 04

    Kosten und Zuverlässigkeit nachziehen

    Wenn es funktioniert, wird es günstig und langweilig gemacht: Caching, kleinere Modelle wo sie reichen, Wiederholungen und sauberes Degradieren.

Meist gebaut mit

GoTypeScriptVektorsucheSelbst gehostete offene ModelleRAG-PipelinesAgenten-Tooling

Wo ich das gemacht habe

Häufige Fragen

Geht das, ohne unsere Daten an OpenAI oder Anthropic zu senden?

Ja. Offene Modelle auf eigener Infrastruktur sind eine echte Option, und bei Verträgen, Personalakten oder allem unter strengem Datenschutz oft die einzige, die eine rechtliche Prüfung übersteht. Der Kompromiss ist real: Sie bekommen Kontrolle und keine Rechnung pro Token, im Tausch gegen Hardware, langsamere Iteration und etwas schwächere Modelle. Ich sage Ihnen, auf welcher Seite dieses Tauschs Ihr Anwendungsfall liegt.

Wie verhindern Sie erfundene Antworten?

Retrieval mit Quellenangaben, sodass jede Antwort auf eine Quelle zeigt, die man öffnen kann; begrenzte statt offener Aufgaben; und ein Bewertungsdatensatz, der Rückschritte vor Ihren Nutzern bemerkt. Halluzinationen lassen sich nicht auf null bringen — deshalb hält ein ehrliches Design überall dort einen Menschen im Ablauf, wo eine falsche Antwort teuer wäre.

Lohnt sich das für ein kleines Unternehmen?

Manchmal nicht, und dann sage ich das. Passiert die Aufgabe zehnmal im Monat, ist ein Mensch günstiger als ein System, das gewartet werden will. Die Rechnung geht auf, wenn das Volumen hoch und die Arbeit wirklich repetitiv ist — Dokumentenverarbeitung, Klassifikation, Extraktion, Erstentwürfe.

Was kostet der Betrieb?

Gehostete Modelle rechnen pro Token ab, die Kosten skalieren also mit der Nutzung und müssen eingeplant werden — Caching, kleinere Modelle für einfachere Schritte und harte Budgetgrenzen. Selbst gehostet verlagert das auf feste Hardwarekosten. So oder so bekommen Sie eine geschätzte Monatssumme vor dem Bauen, nicht danach.

Ein ähnliches Projekt?

Beschreiben Sie mir, was das System leisten und mit welchen Systemen es sprechen muss. Sie bekommen eine klare Einschätzung zu Umfang, Reihenfolge und dem, was ich zuerst bauen würde — noch bevor Sie sich festlegen.

Gespräch beginnen