Commoditech Parlons-en
ServicesModèlesÉtudes de casBlogFAQCarrièresContact
🇵🇱 PL🇬🇧 EN🇩🇪 DE🇫🇷 FR🇪🇸 ES
Parlons-en
← Retour à la liste des articles

Orchestration LLM : coût d'inférence et agents

Cinq agents sur un ticket de helpdesk. Planificateur, chercheur, rédacteur, critique, vérificateur. Chacun appelle le modèle à la suite. L’entrée du suivant contient la sortie du précédent. La latence p99 (le 99e percentile du temps de réponse) est la somme de cinq appels, pas le maximum. La facture est une somme aussi. Un ticket qui coûte 1500 jetons en un appel en coûte 10 500 dans cet équipage, avant que quelqu’un dise « faux ».

L’orchestration LLM (large language model, grand modèle de langage) est la décision de savoir quel appel a le droit d’exister. Le coût d’inférence est le produit du nombre d’appels, des jetons et des reprises. Ce n’est pas le nom du framework sur la diapositive.

Trois motifs que les briefs fondent en « agents » :

  • Routeur. Un petit appel décide si le modèle cher s’exécute. Ong et al., RouteLLM: Learning to Route LLMs with Preference Data (arXiv:2406.18665, 2024). Le résumé : dans une partie des cas, le coût baisse de plus de 2×, sans perte de qualité. Le README du même projet (lm-sys) donne un chiffre plus fort : jusqu’à 85 % moins cher en gardant 95 % de la qualité de GPT-4 sur le benchmark MT Bench. C’est une paire de modèles et ce benchmark. Pas votre trafic.
  • Cascade. Un modèle bon marché répond. Le modèle cher ne démarre que si un vérificateur rejette le résultat. Chen, Zaharia et Zou, FrugalGPT (arXiv:2305.05176, 2023). Tableau 3, même qualité que le meilleur modèle seul : HEADLINES 98,3 % moins cher (coût 33,1 contre 0,6, base GPT-4), OVERRULING 73,3 % (9,7 contre 2,6, base GPT-4), COQA 59,2 % (72,5 contre 29,6, base GPT-3, pas GPT-4). Les auteurs parlent d’une fourchette de 50 % à 98 %. Le résumé : jusqu’à 98 % moins cher, ou 4 % meilleur au même coût. Un autre point de fonctionnement du même article, budget égal à un cinquième du coût de GPT-4 sur HEADLINES : environ 80 % moins cher et +1,5 % de qualité. Ce n’est pas le même pourcentage que 98,3 %.
  • Graphe de rôles. Plusieurs agents, une bande, des outils différents. Utile quand une étape peut s’arrêter sur une condition. Inutile comme cinq intitulés de poste sur une classification de ticket.

La phrase absente de la diapositive « multi-agent »

Le modèle n’est pas la boucle. La boucle est le graphe d’appels. Sans limite d’étapes et sans échantillon de qualité sur votre trafic, le pourcentage de la diapositive est le benchmark de quelqu’un d’autre.

1. Anatomie : pourquoi le cinquième appel est le cher

Le coût ne croît pas linéairement avec le nombre de rôles si chaque rôle ne reçoit que sa propre instruction. Dans un graphe typique, il croît parce que le contexte est concaténé. L’arithmétique ci-dessous suppose un prompt système de 800 jetons, un ticket de 400 jetons et 300 jetons de sortie par étape. Sans cache de préfixe (cache du début commun de la requête), chaque appel repaie ce début.

entrée = 1200 + 1500 + 1800 + 2100 + 2400 = 9000
sortie = 5 × 300                          = 1500
total  = 10500 jetons par ticket
un appel = 800 + 400 + 300                = 1500
rapport = 7

Le facteur sept n’est pas une facture. C’est une addition que l’on peut refaire sur papier. Une reprise de la dernière étape ajoute 2400 jetons d’entrée et 300 de sortie, soit 2700. La queue vient de la reprise, pas du premier appel.

Sur un chemin série, le p99 est une somme. Une hypothèse, pas une lecture de supervision : si un appel dure 2 secondes, cinq appels durent 10 secondes. Les branches parallèles ne raccourcissent l’horloge que jusqu’à la branche la plus lente plus l’appel qui les fusionne. Vous payez toutes les branches, y compris celle dont le résultat part à la corbeille.

Un serveur à vous ne transforme pas cinq appels en un. Kwon, Li et al., PagedAttention et le système vLLM (SOSP 2023, arXiv:2309.06180), rendent un jeton moins cher : sur leur montage de 2023, le débit de modèles courants augmente de 2 à 4 fois face à FasterTransformer et Orca, au même niveau de latence. Le gain est plus fort sur les longues séquences. C’est le rangement du cache clé-valeur (KV cache). Pas une raison d’ajouter un quatrième agent.

Cemri, Pan, Yang et al., Why Do Multi-Agent LLM Systems Fail? (arXiv:2503.13657, version de mars 2025). Taxonomie MAST : 14 modes d’échec en trois paniers, accord des annotateurs kappa 0,88. Les paniers :

  1. Spécification et conception. Un agent ignore la tâche ou son propre rôle. Il ne connaît pas la condition d’arrêt. Il perd l’historique.
  2. Décalage entre agents. L’un ne demande pas, l’autre ne transmet pas ce qu’il sait déjà. La conversation quitte la tâche ou repart de zéro.
  3. Vérification et terminaison. Arrêt trop tôt, pas de contrôle, ou contrôle de la mauvaise chose.

Un exemple de leur trace ChatDev. Tâche : échecs en notation algébrique, coups du type « Ke8 ». Le système rend un jeu qui lit des coordonnées de cases. Le vérificateur constate que le code compile. Il ne vérifie pas les règles des échecs. La compilation est un test bon marché. Ce n’est pas un test de la tâche.

2. Quels chiffres se transportent, et lesquels non

Tableau 4 du même article, jeu ProgramDev (leurs 32 tâches « écris un programme », pas HumanEval). ChatDev dans la topologie de base termine la tâche dans 25,0 % des exécutions. Meilleur prompt : 34,4 %. Nouvelle topologie de graphe : 40,6 %. Dans le texte, les auteurs parlent d’un gain de l’ordre de 14 points de pourcentage et disent clairement que cela ne ferme pas les échecs. HumanEval, sur le même montage, passe de 89,6 % à 91,5 %. Un benchmark déjà haut ne montre pas le coût d’une mauvaise orchestration.

Deuxième expérience, AG2 et GSM-Plus, six répétitions. Avec GPT-4, le meilleur prompt seul passe de 84,75 % à 89,75 %. Une nouvelle topologie à trois rôles reste à 85,50 %, et le test de Wilcoxon contre la base a p = 0,4 : cet écart ne se sépare pas du bruit. Avec GPT-4o, le prompt et la nouvelle topologie battent la base (p = 0,03), tous deux près de 89 %. « Ajoutons un agent » n’est pas un correctif qui gagne quel que soit le modèle.

Un juge modèle (LLM-as-a-judge, notation d’une trace par un autre modèle) n’est pas un audit gratuit. Chez eux, o1 avec des exemples dans le prompt a une exactitude de 0,94 et un kappa de 0,77 face aux humains. Sans exemples, le kappa tombe à 0,58. On peut tamiser des traces avec ça. On ne signe pas une clause de qualité avec ça.

Conclusion d’architecture

D’abord une condition d’arrêt et un contrôle qui connaît la tâche. Ensuite un routeur ou une cascade, calibrés sur votre échantillon, pas sur MT Bench. Un graphe de rôles seulement quand les étapes ont des outils différents et que la boucle peut être coupée. vLLM baisse le prix du jeton sur votre GPU. Il ne baisse pas le nombre d’appels.

3. Exemple : 10 500 jetons avant que quelqu’un dise « faux »

Pratique d’ingénierie : la somme sur papier, avant d’acheter un framework

Un montage qui se répète quand un « équipage d’agents » est posé sur une boîte de tickets (helpdesk, un modèle via API, cinq rôles en série). Ce n’est pas le rapport d’un déploiement nommé. C’est l’arithmétique de la section 1.

  • Chemin heureux, cinq rôles, sans cache de préfixe : 10 500 jetons.
  • Le même ticket en un appel avec outils (function calling : le modèle appelle lui-même une fonction) : 1500 jetons. Rapport 7.
  • Une reprise de la dernière étape : plus 2700 jetons. Personne n’a mesuré à quelle fréquence votre critique l’imposera. MAST dit seulement que la vérification est parfois vide ou contrôle la mauvaise chose.
  • L’horloge, à 2 secondes par appel et sans parallélisme : 10 secondes contre 2 secondes. Le p99 de l’utilisateur voit la somme.

Une coupe qui garde le contrôle : un appel d’un modèle bon marché, un seuil d’acceptation, le modèle cher seulement après rejet. C’est la cascade FrugalGPT, pas un cinquième rôle nommé « senior ». Prenez le seuil sur vos propres tickets. Les 98,3 % de HEADLINES appartiennent à ce jeu de données et à une paire de modèles de 2023.

Les chiffres des articles ne passent pas 1:1 sur votre facture d’API. Le découpage, oui : d’abord le nombre d’appels, ensuite si le vérificateur sait dire « faux », ensuite le prix du jeton. Commencer par vLLM sur un graphe de cinq rôles range la même boucle moins cher.

4. Tableau de décision : quoi appeler, quoi ne pas automatiser

Approche Complexité Latence p99 Coût d’inférence Charge pour l’équipe Quand
Un appel plus des outils Faible Un appel Le plus bas dans l’arithmétique ci-dessus (1500 jetons) Faible, tant que le schéma de réponse est strict Classification, extraction, JSON. Un schéma ou une règle existe
Routeur : modèle fort ou faible Moyenne Un petit appel, parfois un second RouteLLM : plus de 2× dans le résumé. Jusqu’à 85 % et 95 % de la qualité GPT-4 sur MT Bench dans le README Le seuil se calibre sur votre trafic Trafic mixte et un jeu d’évaluation, pas une démo
Cascade avec vérificateur Moyenne Une somme, jusqu’à l’acceptation FrugalGPT : 59,2 %, 73,3 % ou 98,3 %, selon le jeu Un vérificateur qui connaît la tâche Un contrôle automatique existe : test, schéma, règle
Graphe à plusieurs rôles Haute Somme des étapes. Queue en cas de reprise Croît avec le contexte ajouté. Dans l’arithmétique ci-dessus, 7× face à un appel Une trace, une limite d’étapes, un jeu d’éval Les étapes ont des outils différents et peuvent s’arrêter
Votre serveur (vLLM) Haute Dépend de la file, pas du nombre de rôles Jeton moins cher. Même nombre d’appels. Débit 2–4× sur le montage Kwon 2023 Un GPU et une astreinte Gros volume, ou données qui ne peuvent pas aller dans une API tierce

AI / LLM / RAG (retrieval-augmented generation, réponse appuyée sur des documents retrouvés) : taux spécialiste 180–250 PLN/h, taux client 240–350 PLN/h. Environ 35–50 % de plus que Python pour un backend ordinaire. Marge du fournisseur en modèle ouvert : 10–25 %. Une carte du marché, pas un devis. Détail : ce que coûte le body leasing IT en 2026. La recherche documentaire est une autre boucle que le nombre d’appels d’agents. Le réentraînement du modèle en est une troisième : services MLOps.

5. Anti-patrons absents du tutoriel du framework

  1. Cinq rôles pour classer un ticket. Le framework tourne. Le jeu d’évaluation non. ChatDev termine 25,0 % des tâches ProgramDev. Une meilleure topologie atteint 40,6 %, et les auteurs écrivent que ce n’est pas assez pour la production.
  2. Un critique sans condition d’arrêt. MAST : pas de condition de fin, et une vérification qui contrôle la compilation au lieu de la tâche. Un contrôle vide est bon marché et ne prend rien. Un contrôle qui exige toujours une reprise ajoute l’appel le plus cher à la queue.
  3. Un pourcentage d’un jeu étranger écrit dans le contrat. 98,3 % c’est HEADLINES. 85 % c’est MT Bench et la paire de modèles du README RouteLLM. Sur votre trafic, le seuil se recalibre. Sinon l’économie est silencieuse : la qualité baisse, l’API ne renvoie pas d’erreur.
  4. Des journaux de prompts avec des données personnelles dans l’outil de trace de quelqu’un d’autre. Un accord de sous-traitance ne suit pas un SDK qui envoie le texte du ticket « pour déboguer ». La trace reste dans votre projet.

6. Playbook : qui louer, et dans quel ordre

Ne commencez pas par un cinquième rôle. Commencez par la question de ce qui tient la facture : le nombre d’appels, un contrôle manquant, ou le prix du jeton sur votre GPU.

  1. L’API est là, vous utilisez déjà un modèle, il manque une limite d’étapes et un jeu d’évaluation. C’est du body leasing d’un développeur LLM : une personne, votre standup, votre critère d’achèvement (Definition of Done). Le body leasing signifie ici la location d’un spécialiste dans votre équipe, en général au temps passé (time and materials, T&M). Nous ne vendons pas un banc nommé pour lundi matin.
  2. Les données ne peuvent pas aller dans une API, et la trace, l’éval et le serveur n’existent pas. Une personne ne coud pas ça en un sprint. Une équipe : quelqu’un pour l’orchestration, quelqu’un pour le contrôle, quelqu’un pour le service du modèle. C’est plus proche du leasing d’équipes IT que de « on achète encore quelqu’un pour les prompts ». Quand une équipe, quand un rôle : team leasing vs body leasing 2026.
  3. La clé d’API et le dépôt ne partent pas sur un portable. Le contractant travaille dans votre dépôt et avec votre clé. Exporter les journaux « pour reproduire le bug plus vite » est une collection de tickets clients. Clauses : contrats, marges, droits d’auteur.
  4. Montée en charge. Une personne dans une équipe existante : premiers profils en quelques jours, démarrage après vos entretiens et le contrat. Une équipe depuis zéro : des semaines, parce que vous cousez les droits et la condition d’arrêt en production. L’annonce « trois seniors LLM dès lundi » est soit un CV, soit un banc que nous n’avons pas.

Commoditech fait du T&M et du recrutement en CDI depuis Varsovie, depuis 2012. Le réseau compte 80+ spécialistes. Nous ne les gardons pas inactifs sur un banc. Un brief de body leasing ou d’embauche (honoraires de succès, success fee 15–25 %, pas d’embauche signifie pas d’honoraires) peut aussi partir de l’éditeur, via MCP pour agents IA (Model Context Protocol, le protocole par lequel un assistant dans l’éditeur appelle des outils). Un humain chiffre le stack précis. Les fourchettes sont dans l’article sur les taux, pas dans une réponse automatique. Contact : formulaire.

FAQ

En quoi un routeur diffère-t-il d’une cascade et d’un graphe d’agents ?

Un routeur choisit le modèle en un petit appel, et la décision s’arrête là. Une cascade lance un modèle bon marché et n’appelle le modèle cher qu’après rejet par le vérificateur. Un graphe d’agents ajoute des rôles et ajoute en général leur sortie au contexte suivant. Dans l’arithmétique de cet article, cinq rôles sans cache de préfixe font 10 500 jetons contre 1500 pour un appel. RouteLLM et FrugalGPT baissent le coût sur leurs jeux. Un pourcentage de leurs tableaux n’entre pas dans un contrat sans échantillon de votre trafic.

L’économie de 98 % de FrugalGPT se transporte-t-elle sur notre helpdesk ?

Pas comme chiffre de budget. 98,3 % c’est le jeu HEADLINES, coût 33,1 contre 0,6, à la qualité de GPT-4. OVERRULING donne 73,3 %, COQA 59,2 %, et là la base est GPT-3. Les auteurs parlent de 50 % à 98 %. Sur HEADLINES, avec un budget d’un cinquième de GPT-4, un autre point de fonctionnement est environ 80 % moins cher et +1,5 % de qualité. Une cascade a besoin d’exemples étiquetés d’une distribution proche de la production. Sinon le seuil du vérificateur appartient à quelqu’un d’autre.

Combien coûte le body leasing d’un développeur LLM en Pologne en 2026 ?

Sur la carte AI / LLM / RAG : spécialiste 180–250 PLN/h, client 240–350 PLN/h, environ 35–50 % de plus que Python pour un backend ordinaire. Marge du fournisseur en modèle ouvert : 10–25 %. Ce n’est pas un devis. Un humain chiffre le brief. Détail : taux 2026.

Quand une personne, quand une équipe, et peut-on travailler sous NDA ?

Une personne, quand l’API et le modèle sont déjà là et qu’il manque une limite d’étapes, un seuil de routeur et un jeu d’évaluation. Une équipe, quand les données ne peuvent pas aller dans une API tierce et que personne n’a de serveur, de trace ni de contrôle. Oui, sous accord de confidentialité (NDA, non-disclosure agreement) : le contractant travaille dans votre dépôt et avec votre clé. Exporter les journaux de prompts sur un portable est une collection de tickets. Clauses : contrats, marges, droits d’auteur.

Sources

  • Cemri, M., Pan, M. Z., Yang, S. et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657. arxiv.org/abs/2503.13657. Les chiffres du tableau 4 viennent de la version de mars 2025.
  • Chen, L., Zaharia, M., Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176. arxiv.org/abs/2305.05176.
  • Ong, I. et al. (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665. arxiv.org/abs/2406.18665. Le 85 % / 95 % de qualité GPT-4 sur MT Bench est le README du projet lm-sys, pas le résumé (le résumé parle d’une baisse de coût de plus de 2×).
  • Kwon, W., Li, Z. et al. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023, arXiv:2309.06180. arxiv.org/abs/2309.06180.
  • Commoditech — taux de body leasing 2026, développeurs LLM, team leasing vs body leasing.