Commoditech Porozmawiajmy
UsługiModele WspółpracyPortfolioBlogFAQPracaKontakt
🇵🇱 PL🇬🇧 EN🇩🇪 DE🇫🇷 FR🇪🇸 ES
Porozmawiajmy
← Wróć do listy artykułów

Orkiestracja LLM: koszt inferencji i agenci

Pięć agentów na jedno zgłoszenie do helpdesku. Planista, badacz, pisarz, krytyk, weryfikator. Każdy woła model po kolei. Wejście następnego zawiera wyjście poprzedniego. Opóźnienie p99 (99. percentyl czasu odpowiedzi) jest sumą pięciu wywołań, nie maksimum. Faktura też jest sumą. Jedno zgłoszenie, które w jednym wywołaniu zjada 1500 tokenów, w tej piątce zjada 10 500, zanim ktokolwiek powie „źle”.

Orkiestracja LLM (large language model, duży model językowy) to decyzja, które wywołanie w ogóle ma prawo powstać. Koszt inferencji jest iloczynem liczby wywołań, tokenów i powtórek. Nie nazwą frameworka na slajdzie.

Trzy wzorce, które w briefach zlewają się w „agentów”:

  • Router. Jedno małe wywołanie decyduje, czy w ogóle iść w drogi model. Ong i in., RouteLLM: Learning to Route LLMs with Preference Data (arXiv:2406.18665, 2024). Abstrakt: w części przypadków koszt spada ponad 2 razy, bez utraty jakości odpowiedzi. README tego samego projektu (lm-sys) podaje mocniejszą liczbę: do 85% taniej przy zachowaniu 95% jakości GPT-4 na benchmarku MT Bench. To para modeli i ten benchmark. Nie Wasz ruch.
  • Kaskada. Tani model odpowiada. Drogi startuje tylko wtedy, gdy weryfikator odrzuci wynik. Chen, Zaharia i Zou, FrugalGPT (arXiv:2305.05176, 2023). Tabela 3, ten sam poziom jakości co najlepszy pojedynczy model: HEADLINES 98,3% taniej (koszt 33,1 wobec 0,6, baza GPT-4), OVERRULING 73,3% (9,7 wobec 2,6, baza GPT-4), COQA 59,2% (72,5 wobec 29,6, baza GPT-3, nie GPT-4). Autorzy piszą o zakresie od 50% do 98%. Abstrakt: do 98% taniej albo o 4% lepiej przy tym samym koszcie. Osobny punkt tej samej pracy, budżet równy jednej piątej kosztu GPT-4 na HEADLINES: około 80% taniej i o 1,5% wyższa jakość. To nie jest ten sam procent co 98,3%.
  • Graf ról. Kilka agentów, wspólna taśma, różne narzędzia. Ma sens, gdy krok da się zatrzymać warunkiem. Nie ma sensu jako pięć imion na klasyfikację biletu.

Jedno zdanie, którego nie ma na slajdzie „multi-agent”

Model nie jest pętlą. Pętla jest w grafie wywołań. Bez limitu kroków i bez próbki jakości na Waszym ruchu procent ze slajdu jest cudzym benchmarkiem.

1. Anatomia: czemu piąte wywołanie jest najdroższe

Koszt nie rośnie liniowo z liczbą ról, jeśli każda rola dostaje tylko własne polecenie. W typowym grafie rośnie, bo kontekst jest doklejany. Poniższa arytmetyka zakłada prompt systemowy 800 tokenów, treść zgłoszenia 400 tokenów i 300 tokenów odpowiedzi na krok. Bez pamięci podręcznej prefiksu (cache wspólnego początku zapytania) każde wywołanie płaci ten początek od nowa.

wejście = 1200 + 1500 + 1800 + 2100 + 2400 = 9000
wyjście = 5 × 300                         = 1500
razem   = 10500 tokenów na zgłoszenie
jedno wywołanie = 800 + 400 + 300         = 1500
stosunek = 7

Siódmy raz nie jest pomiarem z faktury. Jest dodawaniem, które da się powtórzyć na kartce. Jedno powtórzenie ostatniego kroku dokłada kolejne 2400 tokenów wejścia i 300 wyjścia, czyli 2700. Ogon robi się z powtórki, nie z pierwszego wywołania.

Opóźnienie p99 na ścieżce szeregowej jest sumą. Przyjęcie, nie pomiar z monitoringu: jeśli jedno wywołanie trwa 2 sekundy, pięć wywołań trwa 10 sekund. Równoległe gałęzie skracają zegar tylko do czasu najwolniejszej gałęzi plus wywołanie, które je skleja. Płacicie za wszystkie gałęzie, także za tę, której wynik ląduje w koszu.

Własny serwer nie zamienia pięciu wywołań w jedno. Kwon, Li i in., PagedAttention i system vLLM (SOSP 2023, arXiv:2309.06180), obniżają koszt pojedynczego tokena: w ich układzie z 2023 przepustowość popularnych modeli rośnie 2–4 razy wobec FasterTransformer i Orki, przy tym samym poziomie opóźnienia. Zysk jest większy przy dłuższych sekwencjach. To pakowanie pamięci podręcznej kluczy i wartości (key-value cache, KV cache), nie powód, żeby dodać czwartego agenta.

Cemri, Pan, Yang i in., Why Do Multi-Agent LLM Systems Fail? (arXiv:2503.13657, wersja z marca 2025). Taksonomia MAST: 14 trybów awarii w trzech koszykach, zgodność anotatorów kappa 0,88. Koszyki:

  1. Specyfikacja i projekt. Agent ignoruje treść zadania albo własną rolę. Nie zna warunku stopu. Gubi historię rozmowy.
  2. Rozjazd między agentami. Jeden nie pyta, drugi nie przekazuje tego, co już wie. Rozmowa schodzi z zadania albo startuje od zera.
  3. Weryfikacja i zakończenie. Koniec za wcześnie, brak sprawdzenia albo sprawdzenie niewłaściwej rzeczy.

Przykład z ich śladu ChatDev. Zadanie: szachy z notacją algebraiczną, ruchy w stylu „Ke8”. System oddaje grę, która czyta współrzędne pól. Weryfikator sprawdza, że kod się kompiluje. Nie sprawdza zasad szachów. Kompilacja jest tanim testem. Nie jest testem zadania.

2. Co z tego wynika w liczbach, a co nie

Tabela 4 tej samej pracy, zestaw ProgramDev (ich 32 zadania „napisz program”, nie HumanEval). ChatDev w bazowej topologii kończy zadanie w 25,0% przebiegów. Lepszy prompt: 34,4%. Nowa topologia grafu: 40,6%. W tekście autorzy mówią o poprawie rzędu 14 punktów procentowych i wprost: to nie zamyka awarii. HumanEval na tym samym układzie rusza się z 89,6% do 91,5%. Benchmark, na którym i tak jest wysoko, nie pokaże kosztu złej orkiestracji.

Drugi eksperyment, AG2 i zadania GSM-Plus, sześć powtórzeń. Z GPT-4 sam lepszy prompt idzie z 84,75% do 89,75%. Nowa topologia trzech ról zostaje na 85,50%, a test Wilcoxona wobec bazy ma p = 0,4, czyli tej różnicy nie da się oddzielić od szumu. Z GPT-4o i prompt, i nowa topologia biją bazę (p = 0,03), obie w okolicy 89%. „Dodajmy agenta” nie jest poprawką, która wygrywa niezależnie od modelu.

Sędzia z modelu (LLM-as-a-judge, ocena śladu innym modelem) nie jest darmowym audytem. U nich o1 z przykładami w prompcie ma dokładność 0,94 i kappa 0,77 wobec ludzi. Bez przykładów kappa spada do 0,58. Da się tym przesiewać ślady. Nie da się tym podpisywać umowy o jakości.

Kluczowy wniosek architektoniczny

Najpierw warunek stopu i sprawdzian, który zna treść zadania. Potem router albo kaskada, skalibrowane na Waszej próbce, nie na MT Bench. Graf ról dopiero wtedy, gdy kroki mają różne narzędzia i da się przerwać pętlę. vLLM obniża cenę tokena na własnej karcie. Nie obniża liczby wywołań.

3. Studium: 10 500 tokenów, zanim ktoś powie „źle”

Z praktyki inżynieryjnej: rachunek na kartce, zanim kupicie framework

Układ, który powtarza się przy „załodze agentów” na skrzynce zgłoszeń (helpdesk, jeden model przez API, pięć ról w szeregu). Nie jest to raport z nazwanego wdrożenia. Jest to arytmetyka z sekcji 1.

  • Happy path, pięć ról, bez cache prefiksu: 10 500 tokenów.
  • To samo zgłoszenie jednym wywołaniem z narzędziami (function calling, model sam woła funkcję): 1500 tokenów. Stosunek 7.
  • Jedna powtórka ostatniego kroku: plus 2700 tokenów. Nikt nie zmierzył, jak często Wasz krytyk ją wymusi. MAST mówi tylko, że weryfikacja bywa pusta albo sprawdza nie to, co trzeba.
  • Zegar, przy założeniu 2 sekund na wywołanie i brak równoległości: 10 sekund wobec 2 sekund. P99 użytkownika widzi sumę.

Cięcie, które nadal ma sprawdzenie: jedno wywołanie taniego modelu, próg akceptacji, drogi model tylko po odrzuceniu. To jest kaskada FrugalGPT, nie piąta rola o imieniu „senior”. Próg bierzcie z własnych zgłoszeń. 98,3% z HEADLINES jest własnością tego zbioru i pary modeli z 2023 roku.

Liczby z papierów nie przenoszą się 1:1 na Waszą fakturę za API. Przenosi się podział: najpierw liczba wywołań, potem to, czy weryfikator umie powiedzieć „źle”, potem cena tokena. Kto zaczyna od vLLM na grafie pięciu ról, taniej pakuje tę samą pętlę.

4. Tabela decyzyjna: co wołać, a czego nie automatyzować

Podejście Złożoność Opóźnienie p99 Koszt inferencji Narzut na zespół Kiedy stosować
Jedno wywołanie i narzędzia Niska Jedno wywołanie Najniższy w arytmetyce wyżej (1500 tokenów) Niski, dopóki schemat odpowiedzi jest twardy Klasyfikacja, ekstrakcja, JSON. Jest schemat albo reguła
Router: model silny albo słaby Średnia Małe wywołanie, czasem drugie RouteLLM: ponad 2× w abstrakcie. Do 85% i 95% jakości GPT-4 na MT Bench w README projektu Trzeba skalibrować próg na swoim ruchu Ruch mieszany i jest zbiór ocen, nie demo
Kaskada z weryfikatorem Średnia Suma, aż weryfikator puści FrugalGPT: 59,2%, 73,3% albo 98,3%, zależnie od zbioru Weryfikator, który zna treść zadania Jest automatyczny sprawdzian: test, schemat, reguła
Graf wielu ról Wysoka Suma kroków. Ogon przy powtórce Rośnie z doklejanym kontekstem. W arytmetyce wyżej 7× wobec jednego wywołania Ślad, limit kroków, zbiór eval Kroki mają różne narzędzia i da się je zatrzymać
Własny serwer (vLLM) Wysoka Zależy od kolejki, nie od liczby ról Token tańszy. Liczba wywołań ta sama. 2–4× przepustowości w układzie Kwon 2023 Karta graficzna (GPU) i dyżur Duży wolumen albo dane nie mogą iść do cudzego API

AI / LLM / RAG (retrieval-augmented generation, czyli odpowiedź z doszukanych dokumentów): stawka specjalisty 180–250 PLN/h, stawka dla klienta 240–350 PLN/h. To około 35–50% więcej niż Python od zwykłego backendu. Marża dostawcy przy jawnym modelu 10–25%. Mapa rynku, nie oferta. Rozpisanie: ile kosztuje body leasing IT w 2026. Koszt doszukiwania dokumentów to inna pętla niż liczba wywołań agenta. Retraining modelu to trzecia: usługi MLOps.

5. Anty-wzorce, których nie ma w tutorialu frameworka

  1. Pięć ról na klasyfikację biletu. Framework stoi. Zbioru ocen nie ma. ChatDev na ProgramDev kończy 25,0% zadań. Lepsza topologia dochodzi do 40,6% i autorzy piszą, że to za mało na produkcję.
  2. Krytyk bez warunku stopu. MAST: brak warunku zakończenia oraz weryfikacja, która sprawdza kompilację zamiast zadania. Pusta weryfikacja jest tania i nic nie łapie. Weryfikacja, która zawsze każe powtórzyć, dokłada najdroższe wywołanie do ogona.
  3. Procent z cudzego zbioru wpisany do umowy. 98,3% to HEADLINES. 85% to MT Bench i para modeli z README RouteLLM. Na Waszym ruchu próg kalibruje się od nowa. Inaczej oszczędność jest cicha: jakość spada, API nie zwraca błędu.
  4. Log promptów z danymi osobowymi w cudzym narzędziu do śladów. Umowa powierzenia nie nadąża za SDK, które wysyła treść zgłoszenia „do debugowania”. Ślad ma zostać w Waszym projekcie.

6. Playbook: kogo wynająć i w jakiej kolejności

Nie zaczynajcie od piątej roli. Zacznijcie od pytania, co trzyma fakturę: liczba wywołań, brak sprawdzianu, czy cena tokena na własnej karcie.

  1. API już jest, jednego modelu używacie, brakuje limitu kroków i zbioru ocen. To body leasing dewelopera LLM: jedna osoba, Wasz stand-up, Wasze kryterium ukończenia (Definition of Done). Body leasing znaczy tu wynajem specjalisty do Waszego zespołu, zwykle w rozliczeniu za czas (time and materials, T&M). Nie sprzedajemy imiennej ławki na poniedziałek rano.
  2. Dane nie mogą iść do API, a ślad, eval i serwer nie istnieją. Jedna osoba nie zszyje tego w sprincie. Skład: ktoś od orkiestracji, ktoś od sprawdzianu, ktoś od serwowania. To bliżej leasingu zespołów IT niż „dokupimy jeszcze jednego od promptów”. Kiedy squad, a kiedy jedna rola: team leasing vs body leasing 2026.
  3. Klucz API i repo nie wychodzą na laptop. Kontraktor w Waszym repozytorium i na Waszym kluczu. Eksport logów „żeby szybciej odtworzyć błąd” jest zbiorem zgłoszeń klientów. Klauzule: umowy, marże, prawa autorskie.
  4. Ramp-up. Osoba do istniejącego zespołu: pierwsze profile w ciągu dni, start po Waszych rozmowach i umowie. Skład od zera: tygodnie, bo zszywacie uprawnienia i warunek stopu na produkcji. Zapowiedź „trzech seniorów LLM od poniedziałku” to albo CV, albo ławka, której nie mamy.

Commoditech od 2012 robi T&M i rekrutację stałą z Warszawy. W sieci jest 80+ specjalistów. Nie trzymamy ich bezczynnie na ławce. Brief na body leasing albo na etat (wynagrodzenie za sukces, success fee 15–25%, bez zatrudnienia nie ma opłaty) da się złożyć też z edytora, przez MCP dla agentów AI (Model Context Protocol, protokół, którym asystent w edytorze woła narzędzia). Kwotę na konkretny stack liczy człowiek. Widełki są w artykule o stawkach, nie w odpowiedzi automatu. Kontakt: formularz.

FAQ

Czym router różni się od kaskady i od grafu agentów?

Router jednym małym wywołaniem wybiera model i na tym kończy decyzję. Kaskada puszcza tani model, a drogi woła tylko po odrzuceniu odpowiedzi przez weryfikator. Graf agentów dokleja kolejne role i zwykle dokleja ich wyjście do kontekstu następnej. W arytmetyce z tego artykułu pięć ról bez cache prefiksu to 10 500 tokenów wobec 1500 przy jednym wywołaniu. RouteLLM i FrugalGPT tną koszt na swoich zbiorach. Procentu z ich tabeli nie wpisuje się do umowy bez próbki Waszego ruchu.

Czy 98% oszczędności z FrugalGPT przeniesie się na nasz helpdesk?

Nie jako liczba do budżetu. 98,3% to zbiór HEADLINES, koszt 33,1 wobec 0,6, przy jakości GPT-4. OVERRULING daje 73,3%, COQA 59,2% i tam bazą jest GPT-3. Autorzy piszą o zakresie od 50% do 98%. Na HEADLINES, przy budżecie równym jednej piątej GPT-4, osobny punkt pracy to około 80% taniej i +1,5% jakości. Kaskada potrzebuje oznaczonych przykładów z rozkładu zbliżonego do produkcji. Inaczej próg weryfikatora jest cudzy.

Ile kosztuje body leasing dewelopera LLM w Polsce w 2026?

Na mapie rynku AI / LLM / RAG: specjalista 180–250 PLN/h, klient 240–350 PLN/h, około 35–50% więcej niż Python od zwykłego backendu. Marża dostawcy przy jawnym modelu 10–25%. To nie jest oferta. Kwotę na brief liczy człowiek. Szczegóły: stawki 2026.

Kiedy jedna osoba, a kiedy skład, i czy da się pracować pod NDA?

Jedna osoba, gdy API i model już stoją, a brakuje limitu kroków, progu routera i zbioru ocen. Skład, gdy dane nie mogą iść do cudzego API i nikt nie ma serwera, śladu ani sprawdzianu. Tak, pod umową o poufności (NDA, non-disclosure agreement): kontraktor pracuje w Waszym repozytorium i na Waszym kluczu. Eksport logów promptów na laptop jest zbiorem zgłoszeń. Zapisy: umowy, marże, prawa autorskie.

Źródła

  • Cemri, M., Pan, M. Z., Yang, S. i in. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657. arxiv.org/abs/2503.13657. Liczby z tabeli 4 pochodzą z wersji z marca 2025.
  • Chen, L., Zaharia, M., Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176. arxiv.org/abs/2305.05176.
  • Ong, I. i in. (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665. arxiv.org/abs/2406.18665. Liczba 85% / 95% jakości GPT-4 na MT Bench: README projektu lm-sys, nie abstrakt (abstrakt mówi o obniżeniu kosztu ponad 2 razy).
  • Kwon, W., Li, Z. i in. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023, arXiv:2309.06180. arxiv.org/abs/2309.06180.
  • Commoditech — stawki body leasingu 2026, wynajem deweloperów LLM, team leasing vs body leasing.