makseongmakseong

Integracja LLM

Model wewnątrz produktu, z kosztami i awariami pod kontrolą.

Wywołania modelu wpięte w twoją aplikację z wersjonowaniem promptów, ustrukturyzowanym wyjściem, rozliczaniem kosztów, limitami i wariantami awaryjnymi. Ciekawy jest nie prompt, tylko to, co się dzieje, gdy dostawca jest wolny, drogi albo leży.

StosOpenAIAnthropicGemini

Wycena projektowa

Od 2000 €

To pokrywa jedną funkcję modelu wpiętą w istniejący produkt: ścieżkę wywołania, ustrukturyzowane wyjście, rozliczanie kosztów i wariant awaryjny. Kilka funkcji, zestaw ewaluacyjny i własna bramka idą do 9000 €.

Wyślij opis, a dostaniesz liczbę w odpowiedzi.

Opisz projekt

W demie działało, potem przyszedł prawdziwy ruch

Prototyp odpowiadał dobrze, więc funkcja poszła na produkcję. Potem dostawca miał wolne popołudnie i strona zawisła, bo nikt nie ustawił limitu czasu. Przyszedł rachunek i nikt nie umiał powiedzieć, która funkcja go wygenerowała, bo wywołania nigdy nie były oznaczane. Ktoś poprawił prompt i coś innego po cichu się zepsuło, bo nie było z czym porównać. Model zwrócił tekst tam, gdzie kod czekał na pola, i parser wywalił się na żywym kliencie. Nic z tego nie jest problemem promptu. To instalacja wokół modelu i to ona decyduje, czy funkcja przeżyje pierwszy miesiąc.

Co powstaje

Ścieżka wywołania, która pada kulturalnie

Limity czasu, ponowienia z odczekaniem i wariant awaryjny wybrany zanim będzie potrzebny: mniejszy model, odpowiedź z pamięci podręcznej albo uczciwy komunikat. Strona nigdy nie czeka na dostawcę, który przestał odpowiadać.

Wyjście, któremu kod może ufać

Ustrukturyzowane wyjście ze schematem, walidowane od razu, z przebiegiem naprawczym dla bliskich trafień i czytelnym błędem dla reszty. Aplikacja przestaje parsować tekst i zaczyna czytać pola.

Koszty i prompty, z których da się rozliczyć

Każde wywołanie oznaczone funkcją i najemcą, tokeny i wydatki zapisane, limity na użytkownika i na dobę. Prompty wersjonowane w repozytorium, więc zmiana to diff, który można cofnąć, a nie wspomnienie o tym, co ktoś edytował.

Dlaczego właśnie tak

Dostawca to zależność, nie fundament

Ceny się zmieniają, modele są wycofywane, regiony padają. Integrację pisze się tak, żeby dostawcę dało się wymienić na granicy, a jego zły dzień ograniczał funkcję, zamiast zabierać ze sobą produkt.

Najpierw zmierzyć, potem stroić

Zmiana promptu bez porównania to zgadywanie z dobrą opowieścią. Mały zestaw prawdziwych przypadków, przepuszczony przed i po, zamienia strojenie w coś, co możesz zatwierdzić albo odrzucić.

Jak to przebiega

// 01

Przegląd funkcji, której chcesz, i produktu, w którym ma żyć: gdzie należy wywołanie, jakie dane może widzieć, co dzieje się w czasie oczekiwania i jak ma wyglądać odpowiedź dla kodu dalej.

// 02

Najpierw kontrakt: schemat wyjścia, tryby awarii, budżet na wywołanie i na dobę, ustalone na piśmie zanim powstanie pierwszy prompt.

// 03

Integracja zbudowana za jednym interfejsem, gdzie dostawca, model i prompt to konfiguracja, a nie kod rozsypany po aplikacji.

// 04

Mały zestaw ewaluacyjny z twoich prawdziwych przypadków, przepuszczony przez wersje, żeby decydowały liczby, a nie osoba, która ostatnia dotykała promptu.

// 05

Przekazanie z panelem wydatków i awarii, instrukcją na wypadek przestoju dostawcy i pisemną notatką, czego pilnować w pierwszym miesiącu.

Tło

Ile naprawdę kosztuje utrzymanie funkcji na LLM

Prompt to tania część

Większość pracy w produkcyjnej funkcji modelu nie leży w prompcie. Leży w schemacie, który musi spełnić wyjście, w limicie czasu, ponowieniu, wariancie awaryjnym, limicie na najemcę i w zapisie wydatków. Kto pomija tę warstwę, wdraża szybciej, a przez następny kwartał dobudowuje ją pod presją.

Ustrukturyzowane wyjście przesunęło rodzaj błędu

Przy wyjściu związanym schematem model zwraca pola zamiast tekstu, a ciekawe błędy przenoszą się z parsowania na znaczenie: poprawny obiekt z błędną wartością. To łapie walidacja wobec twoich własnych danych, a nie surowszy prompt.

Wyszukiwanie wygrywa z większym oknem kontekstu

Duże okna pozwoliły wrzucać do promptu wszystko i sprawiły, że jest to drogie. Wybranie kilku istotnych fragmentów jest tańsze, szybsze i łatwiejsze do wytłumaczenia komuś, kto zapyta, skąd wzięła się odpowiedź.

Ewaluacja czyni strojenie uczciwym

Bez stałego zestawu przypadków każdą zmianę promptu ocenia ten, kto próbował jej ostatni. Z zestawem zmiana to liczba, która poszła w górę albo w dół, a wycofanie to decyzja, nie spór.

Opisz projekt

Napisz, co masz i co ma się zmienić. W ciągu dwóch dni roboczych dostajesz pisemną wycenę: zakres rozbity na części z ceną przy każdej, albo pytania, których do niej brakuje. Bez rozmowy wstępnej po drodze.

Imię, adres e-mail i wiadomość służą tylko do udzielenia odpowiedzi. Polityka prywatności

Pytania

Praca z LLM, pytania i odpowiedzi

Zwykle więcej niż jednego. Integrację pisze się pod interfejs, z dostawcą podstawowym i drugim za nim, bo najtańszy model do zadania zmienia się co kilka miesięcy i to właśnie przywiązanie do jednego dostawcy czyni to drogim.

Często nie. Wyszukiwanie po umiarkowanym zbiorze działa na bazie, którą już masz, a osobny magazyn wektorów zarabia na siebie przy skali albo mocnym filtrowaniu. Dokłada się go, gdy tak mówią liczby, a nie domyślnie.

Tak i to część budowy: budżety na użytkownika, na funkcję i na dobę, wymuszone w ścieżce wywołania, a nie obserwowane potem w panelu. Po osiągnięciu limitu funkcja zachowuje się tak, jak wcześniej zdecydowałeś.

Tak, z dobranym pod to dostawcą i regionem albo z otwartym modelem na twojej infrastrukturze. To ograniczenie zmienia architekturę, więc jego miejsce jest w pierwszej rozmowie, a nie w ostatniej.

To zwykły punkt startu. Praca z promptami w prototypie bywa w porządku; brakuje schematu, limitów, wariantu awaryjnego i rozliczania kosztów, a to da się dołożyć bez wyrzucania tego, co działa.

Napisz, co trzeba zbudować

Prześlij, co istnieje i co ma się zmienić. W odpowiedzi dostajesz zakres i cenę, a nie zaproszenie na rozmowę wstępną.

Narzędzie, nie porada prawna - bez gwarancji zgodności.