Commoditech Schreiben Sie uns
ServicesModelleCase StudiesBlogFAQKarriereKontakt
🇵🇱 PL🇬🇧 EN🇩🇪 DE🇫🇷 FR🇪🇸 ES
Schreiben Sie uns
← Zurück zur Artikelliste

LLM-Orchestrierung: Inferenzkosten und Agenten

Fünf Agenten auf ein Helpdesk-Ticket. Planer, Recherche, Autor, Kritiker, Prüfer. Jeder ruft das Modell der Reihe nach. Die Eingabe des nächsten enthält die Ausgabe des vorigen. Die p99-Latenz (das 99. Perzentil der Antwortzeit) ist die Summe von fünf Aufrufen, nicht das Maximum. Die Rechnung ist ebenfalls eine Summe. Ein Ticket, das in einem Aufruf 1500 Token kostet, kostet in dieser Besetzung 10 500 Token, bevor jemand „falsch“ sagt.

LLM-Orchestrierung (large language model, großes Sprachmodell) ist die Entscheidung, welcher Aufruf überhaupt entstehen darf. Inferenzkosten sind das Produkt aus Anzahl der Aufrufe, Token und Wiederholungen. Nicht der Name des Frameworks auf der Folie.

Drei Muster, die in Briefings zu „Agenten“ zusammenfallen:

  • Router. Ein kleiner Aufruf entscheidet, ob das teure Modell überhaupt läuft. Ong u. a., RouteLLM: Learning to Route LLMs with Preference Data (arXiv:2406.18665, 2024). Das Abstract: in einem Teil der Fälle sinken die Kosten um mehr als das Doppelte, ohne Qualitätsverlust. Das README desselben Projekts (lm-sys) nennt eine schärfere Zahl: bis zu 85% günstiger bei 95% der GPT-4-Qualität auf dem Benchmark MT Bench. Das ist ein Modellpaar und dieser Benchmark. Nicht Ihr Verkehr.
  • Kaskade. Ein günstiges Modell antwortet. Das teure startet nur, wenn ein Prüfer das Ergebnis ablehnt. Chen, Zaharia und Zou, FrugalGPT (arXiv:2305.05176, 2023). Tabelle 3, gleiche Qualität wie das beste Einzelmodell: HEADLINES 98,3% günstiger (Kosten 33,1 gegen 0,6, Basis GPT-4), OVERRULING 73,3% (9,7 gegen 2,6, Basis GPT-4), COQA 59,2% (72,5 gegen 29,6, Basis GPT-3, nicht GPT-4). Die Autoren schreiben von einer Spanne von 50% bis 98%. Abstract: bis zu 98% günstiger oder 4% besser bei gleichen Kosten. Ein anderer Betriebspunkt derselben Arbeit, Budget von einem Fünftel der GPT-4-Kosten auf HEADLINES: etwa 80% günstiger und 1,5% höhere Qualität. Das ist nicht derselbe Prozentsatz wie 98,3%.
  • Rollengraph. Mehrere Agenten, ein Band, verschiedene Werkzeuge. Sinnvoll, wenn ein Schritt per Bedingung stoppt. Sinnlos als fünf Jobtitel auf einer Ticket-Klassifikation.

Der Satz, der auf der Folie „Multi-Agent“ fehlt

Das Modell ist nicht die Schleife. Die Schleife ist der Aufrufgraph. Ohne Schrittlimit und ohne Qualitätsstichprobe auf Ihrem Verkehr ist der Prozentsatz auf der Folie der Benchmark von jemand anderem.

1. Anatomie: warum der fünfte Aufruf der teure ist

Die Kosten wachsen nicht linear mit der Zahl der Rollen, wenn jede Rolle nur ihre eigene Anweisung bekommt. In einem typischen Graphen wachsen sie, weil der Kontext angehängt wird. Die Rechnung unten nimmt einen System-Prompt von 800 Token, ein Ticket von 400 Token und 300 Token Ausgabe pro Schritt an. Ohne Präfix-Cache (Cache des gemeinsamen Anfangs der Anfrage) zahlt jeder Aufruf diesen Anfang neu.

Eingabe = 1200 + 1500 + 1800 + 2100 + 2400 = 9000
Ausgabe = 5 × 300                          = 1500
Summe   = 10500 Token pro Ticket
ein Aufruf = 800 + 400 + 300               = 1500
Verhältnis = 7

Der Faktor sieben ist keine Rechnung des Anbieters. Es ist Addition, die sich auf Papier wiederholen lässt. Eine Wiederholung des letzten Schritts legt weitere 2400 Eingabe-Token und 300 Ausgabe-Token drauf, zusammen 2700. Der Schwanz kommt von der Wiederholung, nicht vom ersten Aufruf.

Auf einem seriellen Pfad ist p99 eine Summe. Eine Annahme, keine Ablesung aus dem Monitoring: dauert ein Aufruf 2 Sekunden, dauern fünf Aufrufe 10 Sekunden. Parallele Zweige kürzen die Uhr nur auf den langsamsten Zweig plus den Aufruf, der sie zusammenführt. Sie zahlen alle Zweige, auch den, dessen Ergebnis im Papierkorb landet.

Ein eigener Server macht aus fünf Aufrufen nicht einen. Kwon, Li u. a., PagedAttention und das System vLLM (SOSP 2023, arXiv:2309.06180), verbilligen das einzelne Token: in ihrem Aufbau von 2023 steigt der Durchsatz gängiger Modelle um das 2- bis 4-Fache gegenüber FasterTransformer und Orca, bei gleicher Latenz. Der Gewinn ist bei längeren Sequenzen größer. Das ist das Packen des Key-Value-Cache (KV-Cache). Kein Grund, einen vierten Agenten hinzuzufügen.

Cemri, Pan, Yang u. a., Why Do Multi-Agent LLM Systems Fail? (arXiv:2503.13657, Fassung vom März 2025). Taxonomie MAST: 14 Fehlermodi in drei Körben, Übereinstimmung der Annotatoren Kappa 0,88. Die Körbe:

  1. Spezifikation und Entwurf. Ein Agent ignoriert die Aufgabe oder die eigene Rolle. Er kennt die Stoppbedingung nicht. Er verliert den Gesprächsverlauf.
  2. Versatz zwischen Agenten. Einer fragt nicht, ein anderer gibt nicht weiter, was er schon weiß. Das Gespräch verlässt die Aufgabe oder fängt von vorn an.
  3. Prüfung und Abschluss. Zu früher Stopp, keine Prüfung oder Prüfung der falschen Sache.

Ein Beispiel aus ihrem ChatDev-Trace. Aufgabe: Schach in algebraischer Notation, Züge wie „Ke8“. Das System liefert ein Spiel, das Feldkoordinaten liest. Der Prüfer stellt fest, dass der Code kompiliert. Er prüft nicht die Schachregeln. Kompilieren ist ein billiger Test. Es ist kein Test der Aufgabe.

2. Welche Zahlen sich übertragen und welche nicht

Tabelle 4 derselben Arbeit, Menge ProgramDev (ihre 32 Aufgaben „schreib ein Programm“, nicht HumanEval). ChatDev in der Basis-Topologie schließt die Aufgabe in 25,0% der Läufe ab. Besserer Prompt: 34,4%. Neue Graph-Topologie: 40,6%. Im Text sprechen die Autoren von einer Verbesserung in der Größenordnung von 14 Prozentpunkten und sagen klar: das schließt die Fehler nicht. HumanEval bewegt sich im selben Aufbau von 89,6% auf 91,5%. Ein Benchmark, der schon hoch liegt, zeigt die Kosten schlechter Orchestrierung nicht.

Zweites Experiment, AG2 und GSM-Plus, sechs Wiederholungen. Mit GPT-4 geht allein der bessere Prompt von 84,75% auf 89,75%. Eine neue Topologie mit drei Rollen bleibt bei 85,50%, und der Wilcoxon-Test gegen die Basis hat p = 0,4. Diese Differenz lässt sich nicht vom Rauschen trennen. Mit GPT-4o schlagen Prompt und neue Topologie die Basis (p = 0,03), beide nahe 89%. „Wir fügen einen Agenten hinzu“ ist keine Korrektur, die unabhängig vom Modell gewinnt.

Ein Modell als Richter (LLM-as-a-judge, Bewertung einer Spur durch ein anderes Modell) ist kein kostenloses Audit. Bei ihnen hat o1 mit Beispielen im Prompt eine Genauigkeit von 0,94 und Kappa 0,77 gegenüber Menschen. Ohne Beispiele fällt Kappa auf 0,58. Damit lassen sich Spuren sieben. Damit lässt sich keine Qualitätsklausel unterschreiben.

Architektonische Schlussfolgerung

Zuerst eine Stoppbedingung und eine Prüfung, die die Aufgabe kennt. Dann Router oder Kaskade, kalibriert auf Ihrer Stichprobe, nicht auf MT Bench. Ein Rollengraph erst, wenn die Schritte verschiedene Werkzeuge haben und die Schleife abbrechen kann. vLLM senkt den Tokenpreis auf der eigenen GPU. Es senkt nicht die Zahl der Aufrufe.

3. Beispiel: 10 500 Token, bevor jemand „falsch“ sagt

Aus der Ingenieurpraxis: die Summe auf Papier, bevor Sie ein Framework kaufen

Ein Aufbau, der sich wiederholt, wenn eine „Agenten-Crew“ auf einem Ticket-Postfach sitzt (Helpdesk, ein Modell über die API, fünf Rollen in Serie). Das ist kein Bericht eines benannten Einsatzes. Das ist die Arithmetik aus Abschnitt 1.

  • Happy Path, fünf Rollen, kein Präfix-Cache: 10 500 Token.
  • Dasselbe Ticket in einem Aufruf mit Werkzeugen (Function Calling: das Modell ruft eine Funktion selbst): 1500 Token. Verhältnis 7.
  • Eine Wiederholung des letzten Schritts: plus 2700 Token. Niemand hat gemessen, wie oft Ihr Kritiker sie erzwingt. MAST sagt nur, dass die Prüfung manchmal leer ist oder das Falsche prüft.
  • Die Uhr, bei 2 Sekunden pro Aufruf und ohne Parallelität: 10 Sekunden gegen 2 Sekunden. Das p99 des Nutzers sieht die Summe.

Ein Schnitt, der die Prüfung behält: ein Aufruf eines günstigen Modells, eine Annahmeschwelle, das teure Modell nur nach Ablehnung. Das ist die FrugalGPT-Kaskade, nicht eine fünfte Rolle namens „Senior“. Die Schwelle nehmen Sie aus Ihren eigenen Tickets. Die 98,3% auf HEADLINES gehören zu diesem Datensatz und zu einem Modellpaar von 2023.

Zahlen aus Papieren wandern nicht 1:1 auf Ihre API-Rechnung. Die Trennung wandert: zuerst die Zahl der Aufrufe, dann ob der Prüfer „falsch“ sagen kann, dann der Tokenpreis. Wer mit vLLM auf einem Graphen von fünf Rollen anfängt, packt dieselbe Schleife nur billiger.

4. Entscheidungstabelle: was aufrufen, was nicht automatisieren

Ansatz Aufwand p99-Latenz Inferenzkosten Last für das Team Wann
Ein Aufruf plus Werkzeuge Niedrig Ein Aufruf Am niedrigsten in der Rechnung oben (1500 Token) Niedrig, solange das Antwortschema hart ist Klassifikation, Extraktion, JSON. Schema oder Regel existiert
Router: starkes oder schwaches Modell Mittel Kleiner Aufruf, manchmal ein zweiter RouteLLM: mehr als 2× im Abstract. Bis 85% und 95% GPT-4-Qualität auf MT Bench im README Schwelle muss auf dem eigenen Verkehr kalibriert werden Gemischter Verkehr und ein Evaluationssatz, kein Demo
Kaskade mit Prüfer Mittel Summe, bis der Prüfer freigibt FrugalGPT: 59,2%, 73,3% oder 98,3%, je nach Datensatz Ein Prüfer, der die Aufgabe kennt Es gibt eine automatische Prüfung: Test, Schema, Regel
Graph mit vielen Rollen Hoch Summe der Schritte. Schwanz bei Wiederholung Wächst mit angehängtem Kontext. In der Rechnung oben 7× gegenüber einem Aufruf Spur, Schrittlimit, Eval-Satz Schritte haben verschiedene Werkzeuge und lassen sich stoppen
Eigener Server (vLLM) Hoch Hängt an der Warteschlange, nicht an der Rollenzahl Token billiger. Dieselbe Aufrufzahl. 2–4× Durchsatz im Aufbau von Kwon 2023 GPU und Bereitschaft Hohes Volumen, oder Daten dürfen nicht in eine fremde API

AI / LLM / RAG (Retrieval-Augmented Generation, Antwort aus abgerufenen Dokumenten): Satz des Spezialisten 180–250 PLN/h, Satz für den Kunden 240–350 PLN/h. Etwa 35–50% mehr als Python für gewöhnliches Backend. Marge des Anbieters bei offenem Modell 10–25%. Eine Marktkarte, kein Angebot. Aufschlüsselung: was IT-Body-Leasing 2026 kostet. Dokumentensuche ist eine andere Schleife als die Zahl der Agentenaufrufe. Neutraining des Modells ist eine dritte: MLOps-Leistungen.

5. Antimuster, die im Framework-Tutorial fehlen

  1. Fünf Rollen für die Ticket-Klassifikation. Das Framework steht. Der Evaluationssatz nicht. ChatDev schließt 25,0% der ProgramDev-Aufgaben ab. Eine bessere Topologie kommt auf 40,6%, und die Autoren schreiben, das reiche für Produktion nicht.
  2. Kritiker ohne Stoppbedingung. MAST: keine Abschlussbedingung, und eine Prüfung, die Kompilierung statt der Aufgabe prüft. Eine leere Prüfung ist billig und fängt nichts. Eine Prüfung, die immer eine Wiederholung verlangt, legt den teuersten Aufruf auf den Schwanz.
  3. Ein Prozentsatz aus einem fremden Datensatz im Vertrag. 98,3% ist HEADLINES. 85% ist MT Bench und das Modellpaar im RouteLLM-README. Auf Ihrem Verkehr wird die Schwelle neu kalibriert. Sonst ist die Ersparnis still: die Qualität fällt, die API liefert keinen Fehler.
  4. Prompt-Logs mit personenbezogenen Daten in einem fremden Trace-Werkzeug. Ein Auftragsverarbeitungsvertrag kommt einem SDK nicht hinterher, das Tickettext „zum Debuggen“ sendet. Die Spur bleibt in Ihrem Projekt.

6. Playbook: wen mieten, und in welcher Reihenfolge

Fangen Sie nicht bei der fünften Rolle an. Fangen Sie bei der Frage an, was die Rechnung hält: die Zahl der Aufrufe, eine fehlende Prüfung oder der Tokenpreis auf der eigenen GPU.

  1. Die API steht, ein Modell ist im Einsatz, es fehlen Schrittlimit und Evaluationssatz. Das ist Body Leasing eines LLM-Entwicklers: eine Person, Ihr Stand-up, Ihre Definition of Done. Body Leasing heißt hier: ein Spezialist in Ihrem Team, meist nach Zeit abgerechnet (Time and Materials, T&M). Wir verkaufen keine namentliche Bank für Montagmorgen.
  2. Daten dürfen nicht in eine API, und Spur, Eval und Server fehlen. Eine Person näht das nicht in einem Sprint. Ein Squad: jemand für Orchestrierung, jemand für die Prüfung, jemand fürs Serving. Das liegt näher am Leasing von IT-Teams als an „wir kaufen noch jemanden für Prompts“. Wann ein Squad, wann eine Rolle: Team Leasing vs Body Leasing 2026.
  3. API-Schlüssel und Repository verlassen den Laptop nicht. Der Kontraktor arbeitet in Ihrem Repository und mit Ihrem Schlüssel. Logs zu exportieren, „um den Fehler schneller nachzustellen“, ist eine Sammlung von Kundentickets. Klauseln: Verträge, Margen, Urheberrecht.
  4. Ramp-up. Eine Person in ein bestehendes Team: erste Profile innerhalb von Tagen, Start nach Ihren Gesprächen und dem Vertrag. Ein Squad von null: Wochen, weil Sie Rechte und die Stoppbedingung in Produktion zusammennähen. Die Ansage „drei Senior-LLM ab Montag“ ist entweder ein Lebenslauf oder eine Bank, die wir nicht halten.

Commoditech macht seit 2012 T&M und Festanstellung aus Warschau. Im Netz sind 80+ Spezialisten. Wir halten sie nicht untätig auf der Bank. Ein Brief für Body Leasing oder für eine Festanstellung (Erfolgshonorar, Success Fee 15–25%, keine Einstellung heißt keine Gebühr) lässt sich auch aus dem Editor ablegen, über MCP für KI-Agenten (Model Context Protocol, das Protokoll, mit dem ein Assistent im Editor Werkzeuge aufruft). Den Betrag für den konkreten Stack rechnet ein Mensch. Die Bänder stehen im Artikel zu den Sätzen, nicht in einer automatischen Antwort. Kontakt: Formular.

FAQ

Wie unterscheidet sich ein Router von einer Kaskade und von einem Agentengraphen?

Ein Router wählt mit einem kleinen Aufruf das Modell, und die Entscheidung endet dort. Eine Kaskade lässt ein günstiges Modell laufen und ruft das teure nur nach Ablehnung durch den Prüfer. Ein Agentengraph hängt weitere Rollen an und hängt ihre Ausgabe meist an den nächsten Kontext. In der Rechnung dieses Artikels sind fünf Rollen ohne Präfix-Cache 10 500 Token gegen 1500 bei einem Aufruf. RouteLLM und FrugalGPT senken Kosten auf ihren Datensätzen. Ein Prozentsatz aus ihren Tabellen gehört nicht in einen Vertrag ohne Stichprobe Ihres Verkehrs.

Überträgt sich die 98%-Ersparnis von FrugalGPT auf unseren Helpdesk?

Nicht als Zahl fürs Budget. 98,3% ist der Datensatz HEADLINES, Kosten 33,1 gegen 0,6, bei GPT-4-Qualität. OVERRULING ergibt 73,3%, COQA 59,2%, und dort ist die Basis GPT-3. Die Autoren schreiben von 50% bis 98%. Auf HEADLINES, bei einem Budget von einem Fünftel von GPT-4, ist ein anderer Betriebspunkt etwa 80% günstiger und +1,5% Qualität. Eine Kaskade braucht markierte Beispiele aus einer Verteilung nahe an der Produktion. Sonst gehört die Schwelle des Prüfers jemand anderem.

Was kostet Body Leasing eines LLM-Entwicklers in Polen 2026?

Auf der Marktkarte AI / LLM / RAG: Spezialist 180–250 PLN/h, Kunde 240–350 PLN/h, etwa 35–50% mehr als Python für gewöhnliches Backend. Marge des Anbieters bei offenem Modell 10–25%. Das ist kein Angebot. Den Betrag auf das Briefing rechnet ein Mensch. Details: Sätze 2026.

Wann eine Person, wann ein Squad, und geht das unter NDA?

Eine Person, wenn API und Modell schon stehen und Schrittlimit, Router-Schwelle und Evaluationssatz fehlen. Ein Squad, wenn Daten nicht in eine fremde API dürfen und niemand Server, Spur oder Prüfung hat. Ja, unter einer Geheimhaltungsvereinbarung (NDA, non-disclosure agreement): der Kontraktor arbeitet in Ihrem Repository und mit Ihrem Schlüssel. Der Export von Prompt-Logs auf einen Laptop ist eine Ticket-Sammlung. Klauseln: Verträge, Margen, Urheberrecht.

Quellen

  • Cemri, M., Pan, M. Z., Yang, S. u. a. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657. arxiv.org/abs/2503.13657. Die Zahlen aus Tabelle 4 stammen aus der Fassung vom März 2025.
  • Chen, L., Zaharia, M., Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176. arxiv.org/abs/2305.05176.
  • Ong, I. u. a. (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665. arxiv.org/abs/2406.18665. Die Zahl 85% / 95% GPT-4-Qualität auf MT Bench steht im README des Projekts lm-sys, nicht im Abstract (das Abstract spricht von mehr als einer Halbierung der Kosten).
  • Kwon, W., Li, Z. u. a. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023, arXiv:2309.06180. arxiv.org/abs/2309.06180.
  • Commoditech — Body-Leasing-Sätze 2026, LLM-Entwickler mieten, Team Leasing vs Body Leasing.