Integracja LLM
Model wewnątrz produktu, z kosztami i awariami pod kontrolą.
Wywołania modelu wpięte w twoją aplikację z wersjonowaniem promptów, ustrukturyzowanym wyjściem, rozliczaniem kosztów, limitami i wariantami awaryjnymi. Ciekawy jest nie prompt, tylko to, co się dzieje, gdy dostawca jest wolny, drogi albo leży.
Wycena projektowa
Od 2000 €
To pokrywa jedną funkcję modelu wpiętą w istniejący produkt: ścieżkę wywołania, ustrukturyzowane wyjście, rozliczanie kosztów i wariant awaryjny. Kilka funkcji, zestaw ewaluacyjny i własna bramka idą do 9000 €.
Wyślij opis, a dostaniesz liczbę w odpowiedzi.
Opisz projektW demie działało, potem przyszedł prawdziwy ruch
Prototyp odpowiadał dobrze, więc funkcja poszła na produkcję. Potem dostawca miał wolne popołudnie i strona zawisła, bo nikt nie ustawił limitu czasu. Przyszedł rachunek i nikt nie umiał powiedzieć, która funkcja go wygenerowała, bo wywołania nigdy nie były oznaczane. Ktoś poprawił prompt i coś innego po cichu się zepsuło, bo nie było z czym porównać. Model zwrócił tekst tam, gdzie kod czekał na pola, i parser wywalił się na żywym kliencie. Nic z tego nie jest problemem promptu. To instalacja wokół modelu i to ona decyduje, czy funkcja przeżyje pierwszy miesiąc.
Co powstaje
Ścieżka wywołania, która pada kulturalnie
Limity czasu, ponowienia z odczekaniem i wariant awaryjny wybrany zanim będzie potrzebny: mniejszy model, odpowiedź z pamięci podręcznej albo uczciwy komunikat. Strona nigdy nie czeka na dostawcę, który przestał odpowiadać.
Wyjście, któremu kod może ufać
Ustrukturyzowane wyjście ze schematem, walidowane od razu, z przebiegiem naprawczym dla bliskich trafień i czytelnym błędem dla reszty. Aplikacja przestaje parsować tekst i zaczyna czytać pola.
Koszty i prompty, z których da się rozliczyć
Każde wywołanie oznaczone funkcją i najemcą, tokeny i wydatki zapisane, limity na użytkownika i na dobę. Prompty wersjonowane w repozytorium, więc zmiana to diff, który można cofnąć, a nie wspomnienie o tym, co ktoś edytował.
Dlaczego właśnie tak
Dostawca to zależność, nie fundament
Ceny się zmieniają, modele są wycofywane, regiony padają. Integrację pisze się tak, żeby dostawcę dało się wymienić na granicy, a jego zły dzień ograniczał funkcję, zamiast zabierać ze sobą produkt.
Najpierw zmierzyć, potem stroić
Zmiana promptu bez porównania to zgadywanie z dobrą opowieścią. Mały zestaw prawdziwych przypadków, przepuszczony przed i po, zamienia strojenie w coś, co możesz zatwierdzić albo odrzucić.
Jak to przebiega
Przegląd funkcji, której chcesz, i produktu, w którym ma żyć: gdzie należy wywołanie, jakie dane może widzieć, co dzieje się w czasie oczekiwania i jak ma wyglądać odpowiedź dla kodu dalej.
Najpierw kontrakt: schemat wyjścia, tryby awarii, budżet na wywołanie i na dobę, ustalone na piśmie zanim powstanie pierwszy prompt.
Integracja zbudowana za jednym interfejsem, gdzie dostawca, model i prompt to konfiguracja, a nie kod rozsypany po aplikacji.
Mały zestaw ewaluacyjny z twoich prawdziwych przypadków, przepuszczony przez wersje, żeby decydowały liczby, a nie osoba, która ostatnia dotykała promptu.
Przekazanie z panelem wydatków i awarii, instrukcją na wypadek przestoju dostawcy i pisemną notatką, czego pilnować w pierwszym miesiącu.
Tło
Ile naprawdę kosztuje utrzymanie funkcji na LLM
Prompt to tania część
Większość pracy w produkcyjnej funkcji modelu nie leży w prompcie. Leży w schemacie, który musi spełnić wyjście, w limicie czasu, ponowieniu, wariancie awaryjnym, limicie na najemcę i w zapisie wydatków. Kto pomija tę warstwę, wdraża szybciej, a przez następny kwartał dobudowuje ją pod presją.
Ustrukturyzowane wyjście przesunęło rodzaj błędu
Przy wyjściu związanym schematem model zwraca pola zamiast tekstu, a ciekawe błędy przenoszą się z parsowania na znaczenie: poprawny obiekt z błędną wartością. To łapie walidacja wobec twoich własnych danych, a nie surowszy prompt.
Wyszukiwanie wygrywa z większym oknem kontekstu
Duże okna pozwoliły wrzucać do promptu wszystko i sprawiły, że jest to drogie. Wybranie kilku istotnych fragmentów jest tańsze, szybsze i łatwiejsze do wytłumaczenia komuś, kto zapyta, skąd wzięła się odpowiedź.
Ewaluacja czyni strojenie uczciwym
Bez stałego zestawu przypadków każdą zmianę promptu ocenia ten, kto próbował jej ostatni. Z zestawem zmiana to liczba, która poszła w górę albo w dół, a wycofanie to decyzja, nie spór.
Powiązane usługi
Opisz projekt
Napisz, co masz i co ma się zmienić. W ciągu dwóch dni roboczych dostajesz pisemną wycenę: zakres rozbity na części z ceną przy każdej, albo pytania, których do niej brakuje. Bez rozmowy wstępnej po drodze.
Pytania
Praca z LLM, pytania i odpowiedzi
Zwykle więcej niż jednego. Integrację pisze się pod interfejs, z dostawcą podstawowym i drugim za nim, bo najtańszy model do zadania zmienia się co kilka miesięcy i to właśnie przywiązanie do jednego dostawcy czyni to drogim.
Często nie. Wyszukiwanie po umiarkowanym zbiorze działa na bazie, którą już masz, a osobny magazyn wektorów zarabia na siebie przy skali albo mocnym filtrowaniu. Dokłada się go, gdy tak mówią liczby, a nie domyślnie.
Tak i to część budowy: budżety na użytkownika, na funkcję i na dobę, wymuszone w ścieżce wywołania, a nie obserwowane potem w panelu. Po osiągnięciu limitu funkcja zachowuje się tak, jak wcześniej zdecydowałeś.
Tak, z dobranym pod to dostawcą i regionem albo z otwartym modelem na twojej infrastrukturze. To ograniczenie zmienia architekturę, więc jego miejsce jest w pierwszej rozmowie, a nie w ostatniej.
To zwykły punkt startu. Praca z promptami w prototypie bywa w porządku; brakuje schematu, limitów, wariantu awaryjnego i rozliczania kosztów, a to da się dołożyć bez wyrzucania tego, co działa.