makseongmakseong

LLM-Integration

Ein Modell in Ihrem Produkt, mit Kosten und Fehlern unter Kontrolle.

Modellaufrufe in Ihrer Anwendung mit Prompt-Versionierung, strukturierten Ausgaben, Kostenerfassung, Ratenbegrenzung und Fallbacks. Interessant ist nicht der Prompt, sondern was passiert, wenn der Anbieter langsam, teuer oder ausgefallen ist.

StackOpenAIAnthropicGemini

Projektpreis

Ab 2.000 €

Das deckt eine Modellfunktion in einem bestehenden Produkt ab: den Aufrufpfad, strukturierte Ausgabe, Kostenerfassung und einen Fallback. Mehrere Funktionen, ein Evaluationsaufbau und ein selbst betriebenes Gateway laufen bis 9.000 €.

Schicken Sie die Beschreibung, Sie bekommen eine Zahl zurück.

Projekt beschreiben

Im Demo lief es, dann kam echter Traffic

Der Prototyp antwortete gut, also ging die Funktion live. Dann hatte der Anbieter einen langsamen Nachmittag und die Seite hing, weil niemand ein Timeout gesetzt hatte. Die Rechnung kam, und keiner konnte sagen, welche Funktion sie verursacht hat, weil die Aufrufe nie markiert wurden. Jemand verbesserte einen Prompt, und etwas anderes wurde still schlechter, weil es nichts zum Vergleichen gab. Das Modell lieferte Fließtext, wo der Code Felder erwartete, und der Parser brach bei einer Kundin ab. Nichts davon ist ein Prompt-Problem. Es ist die Infrastruktur um das Modell herum, und sie entscheidet, ob die Funktion ihren ersten Monat übersteht.

Was gebaut wird

Ein Aufrufpfad, der sauber scheitert

Timeouts, Wiederholungen mit Backoff und ein Fallback, der feststeht, bevor er gebraucht wird: ein kleineres Modell, eine zwischengespeicherte Antwort oder eine ehrliche Meldung. Die Seite wartet nie auf einen Anbieter, der aufgehört hat zu antworten.

Ausgaben, denen der Code trauen kann

Strukturierte Ausgabe mit Schema, beim Eintreffen validiert, mit einem Reparaturlauf für knappe Fehlschläge und einem klaren Fehler für den Rest. Die Anwendung liest Felder statt Prosa.

Kosten und Prompts, die nachvollziehbar bleiben

Jeder Aufruf nach Funktion und Mandant markiert, Tokens und Ausgaben erfasst, Limits pro Nutzer und pro Tag. Prompts im Repository versioniert, damit eine Änderung ein Diff ist, den Sie zurücknehmen können, und nicht eine Erinnerung daran, was jemand editiert hat.

Warum es so gebaut wird

Der Anbieter ist eine Abhängigkeit, kein Fundament

Preise ändern sich, Modelle werden abgekündigt, Regionen fallen aus. Die Integration wird so geschrieben, dass der Anbieter an der Grenze austauschbar bleibt und ein schlechter Tag beim Anbieter die Funktion einschränkt, statt das Produkt mitzunehmen.

Erst messen, dann tunen

Eine Prompt-Änderung ohne Vergleich ist eine Vermutung mit guter Erzählung. Ein kleiner Satz echter Fälle, vorher und nachher durchgelaufen, macht aus dem Tunen etwas, das Sie freigeben oder ablehnen können.

Wie es abläuft

// 01

Ein Blick auf die gewünschte Funktion und das Produkt, in dem sie lebt: wohin der Aufruf gehört, welche Daten er sehen darf, was während der Wartezeit passiert und wie die Antwort für den nachgelagerten Code aussehen muss.

// 02

Zuerst der Vertrag: das Schema der Ausgabe, die Fehlerfälle, das Budget pro Aufruf und pro Tag, schriftlich vereinbart, bevor ein Prompt geschrieben wird.

// 03

Die Integration hinter einer Schnittstelle gebaut, mit Anbieter, Modell und Prompt als Konfiguration statt als Code, der über die Anwendung verstreut ist.

// 04

Ein kleiner Evaluationssatz aus Ihren echten Fällen, gegen die Versionen gefahren, damit Zahlen entscheiden und nicht die Person, die zuletzt am Prompt war.

// 05

Übergabe mit dem Dashboard für Ausgaben und Fehler, dem Runbook für einen Anbieterausfall und einer schriftlichen Notiz, worauf im ersten Monat zu achten ist.

Hintergrund

Was eine LLM-Funktion im Betrieb wirklich kostet

Der Prompt ist der billige Teil

Der Aufwand einer produktiven Modellfunktion steckt nicht im Prompt. Er steckt im Schema, das die Ausgabe erfüllen muss, im Timeout, im Retry, im Fallback, im Limit pro Mandant und in der Aufzeichnung der Ausgaben. Wer diese Schicht überspringt, liefert schneller und baut sie im Quartal darauf unter Druck nach.

Strukturierte Ausgabe hat den Fehlerfall verschoben

Mit schemagebundener Ausgabe liefert das Modell Felder statt Prosa, und die interessanten Fehler wandern vom Parsen zur Bedeutung: ein gültiges Objekt mit falschem Wert. Das fängt Validierung gegen Ihre eigenen Daten ab, kein strengerer Prompt.

Retrieval schlägt ein größeres Kontextfenster

Große Kontextfenster machten es möglich, alles in den Prompt zu kippen, und teuer, es zu tun. Die wenigen relevanten Passagen auszuwählen ist günstiger, schneller und leichter zu erklären, wenn jemand fragt, woher eine Antwort kam.

Evaluation macht das Tunen ehrlich

Ohne festen Satz von Fällen beurteilt jede Prompt-Änderung die Person, die sie zuletzt ausprobiert hat. Mit einem solchen Satz ist eine Änderung eine Zahl, die steigt oder fällt, und ein Rollback eine Entscheidung statt einer Diskussion.

Projekt beschreiben

Sagen Sie, was vorhanden ist und was sich ändern soll. Innerhalb von zwei Werktagen bekommen Sie eine schriftliche Kalkulation: den Umfang nach Teilen aufgeschlüsselt mit einem Preis je Teil, oder die Fragen, die dafür noch fehlen. Kein Kennenlerngespräch dazwischen.

Name, E-Mail und Nachricht werden genutzt, um Ihnen zu antworten, und für nichts sonst. Datenschutz

Fragen

LLM-Arbeit, gefragt und beantwortet

Meist mehr als einen. Die Integration wird gegen eine Schnittstelle geschrieben, mit einem primären Anbieter und einem zweiten dahinter, weil sich das günstigste Modell für eine Aufgabe alle paar Monate ändert und genau die Bindung an einen Anbieter das teuer macht.

Oft nicht. Retrieval über einen überschaubaren Bestand läuft auf der Datenbank, die Sie schon haben, und ein eigener Vektorspeicher lohnt sich bei Größe oder starker Filterung. Er kommt dazu, wenn die Zahlen es sagen, nicht als Standard.

Ja, und das gehört zum Bau: Budgets pro Nutzer, pro Funktion und pro Tag, im Aufrufpfad durchgesetzt statt hinterher im Dashboard beobachtet. Ist ein Limit erreicht, verhält sich die Funktion so, wie Sie es vorher festgelegt haben.

Ja, mit entsprechend gewähltem Anbieter und Region oder mit einem offenen Modell auf Ihrer eigenen Infrastruktur. Das ist eine Rahmenbedingung, die die Architektur verändert, also gehört sie in das erste Gespräch und nicht in das letzte.

Das ist der übliche Ausgangspunkt. Die Prompt-Arbeit im Prototyp ist oft in Ordnung; es fehlen Schema, Limits, Fallback und Kostenerfassung, und die lassen sich ergänzen, ohne das Funktionierende wegzuwerfen.

Sagen Sie, was gebaut werden muss

Schicken Sie, was vorhanden ist und was sich ändern soll. Sie bekommen Umfang und Preis zurück, kein Kennenlerngespräch.

Ein Werkzeug, keine Rechtsberatung - keine Konformitätsgarantie.