Commoditech Hablemos
ServiciosModelosCasos de estudioBlogFAQEmpleoContacto
🇵🇱 PL🇬🇧 EN🇩🇪 DE🇫🇷 FR🇪🇸 ES
Hablemos
← Volver a la lista de artículos

Orquestación LLM: coste de inferencia y agentes

Cinco agentes para un ticket de helpdesk. Planificador, investigador, redactor, crítico, verificador. Cada uno llama al modelo en serie. La entrada del siguiente contiene la salida del anterior. La latencia p99 (el percentil 99 del tiempo de respuesta) es la suma de cinco llamadas, no el máximo. La factura también es una suma. Un ticket que cuesta 1500 tokens en una llamada cuesta 10 500 tokens en ese equipo, antes de que alguien diga «mal».

La orquestación LLM (large language model, modelo de lenguaje grande) es la decisión de qué llamada tiene derecho a existir. El coste de inferencia es el producto del número de llamadas, los tokens y las repeticiones. No es el nombre del framework en la diapositiva.

Tres patrones que los briefs funden en «agentes»:

  • Router. Una llamada pequeña decide si el modelo caro llega a ejecutarse. Ong y otros, RouteLLM: Learning to Route LLMs with Preference Data (arXiv:2406.18665, 2024). El resumen: en parte de los casos el coste baja más de 2×, sin perder calidad. El README del mismo proyecto (lm-sys) da una cifra más fuerte: hasta un 85% más barato manteniendo el 95% de la calidad de GPT-4 en el benchmark MT Bench. Es un par de modelos y ese benchmark. No es su tráfico.
  • Cascada. Un modelo barato responde. El caro arranca solo cuando un verificador rechaza el resultado. Chen, Zaharia y Zou, FrugalGPT (arXiv:2305.05176, 2023). Tabla 3, la misma calidad que el mejor modelo suelto: HEADLINES un 98,3% más barato (coste 33,1 frente a 0,6, base GPT-4), OVERRULING un 73,3% (9,7 frente a 2,6, base GPT-4), COQA un 59,2% (72,5 frente a 29,6, base GPT-3, no GPT-4). Los autores hablan de un rango del 50% al 98%. El resumen: hasta un 98% más barato, o un 4% mejor al mismo coste. Otro punto de trabajo del mismo artículo, presupuesto de un quinto del coste de GPT-4 en HEADLINES: alrededor de un 80% más barato y un 1,5% más de calidad. No es el mismo porcentaje que el 98,3%.
  • Grafo de roles. Varios agentes, una cinta, herramientas distintas. Tiene sentido cuando un paso se puede parar con una condición. No lo tiene como cinco cargos sobre una clasificación de tickets.

La frase que falta en la diapositiva «multi-agent»

El modelo no es el bucle. El bucle es el grafo de llamadas. Sin un límite de pasos y sin una muestra de calidad sobre su tráfico, el porcentaje de la diapositiva es el benchmark de otro.

1. Anatomía: por qué la quinta llamada es la cara

El coste no crece de forma lineal con el número de roles si cada rol solo recibe su propia instrucción. En un grafo típico sí crece, porque el contexto se concatena. La aritmética de abajo supone un prompt de sistema de 800 tokens, un ticket de 400 tokens y 300 tokens de salida por paso. Sin caché de prefijo (caché del inicio compartido de la petición) cada llamada vuelve a pagar ese inicio.

entrada = 1200 + 1500 + 1800 + 2100 + 2400 = 9000
salida  = 5 × 300                          = 1500
total   = 10500 tokens por ticket
una llamada = 800 + 400 + 300              = 1500
razón   = 7

El factor siete no es una factura. Es una suma que se puede repetir en papel. Una repetición del último paso añade otros 2400 tokens de entrada y 300 de salida, 2700 en total. La cola sale de la repetición, no de la primera llamada.

En un camino en serie, el p99 es una suma. Una hipótesis, no una lectura de la monitorización: si una llamada tarda 2 segundos, cinco llamadas tardan 10 segundos. Las ramas en paralelo solo acortan el reloj hasta la rama más lenta más la llamada que las une. Se pagan todas las ramas, también la cuyo resultado acaba en la papelera.

Un servidor propio no convierte cinco llamadas en una. Kwon, Li y otros, PagedAttention y el sistema vLLM (SOSP 2023, arXiv:2309.06180), abaratan el token suelto: en su montaje de 2023 el rendimiento de modelos habituales sube de 2 a 4 veces frente a FasterTransformer y Orca, al mismo nivel de latencia. La ganancia es mayor en secuencias largas. Eso es empaquetar la caché clave-valor (KV cache). No es un motivo para añadir un cuarto agente.

Cemri, Pan, Yang y otros, Why Do Multi-Agent LLM Systems Fail? (arXiv:2503.13657, versión de marzo de 2025). Taxonomía MAST: 14 modos de fallo en tres cestas, acuerdo de los anotadores kappa 0,88. Las cestas:

  1. Especificación y diseño. Un agente ignora la tarea o su propio rol. No conoce la condición de parada. Pierde el historial.
  2. Desalineación entre agentes. Uno no pregunta, otro no pasa lo que ya sabe. La conversación se sale de la tarea o empieza de cero.
  3. Verificación y cierre. Parada demasiado pronto, sin comprobación, o comprobación de lo que no toca.

Un ejemplo de su traza de ChatDev. Tarea: ajedrez en notación algebraica, jugadas del estilo «Ke8». El sistema entrega un juego que lee coordenadas de casillas. El verificador comprueba que el código compila. No comprueba las reglas del ajedrez. Compilar es una prueba barata. No es una prueba de la tarea.

2. Qué números se trasladan y cuáles no

Tabla 4 del mismo trabajo, conjunto ProgramDev (sus 32 tareas de «escribe un programa», no HumanEval). ChatDev en la topología base termina la tarea en el 25,0% de las ejecuciones. Mejor prompt: 34,4%. Nueva topología de grafo: 40,6%. En el texto los autores hablan de una mejora del orden de 14 puntos porcentuales y dicen con claridad que eso no cierra los fallos. HumanEval, en el mismo montaje, pasa del 89,6% al 91,5%. Un benchmark que ya está alto no enseña el coste de una mala orquestación.

Segundo experimento, AG2 y GSM-Plus, seis repeticiones. Con GPT-4, solo el mejor prompt pasa del 84,75% al 89,75%. Una topología nueva de tres roles se queda en el 85,50%, y la prueba de Wilcoxon contra la base tiene p = 0,4: esa diferencia no se separa del ruido. Con GPT-4o, tanto el prompt como la nueva topología baten la base (p = 0,03), ambos cerca del 89%. «Añadamos un agente» no es un arreglo que gane con independencia del modelo.

Un juez modelo (LLM-as-a-judge, puntuar una traza con otro modelo) no es una auditoría gratis. En su montaje, o1 con ejemplos en el prompt tiene una exactitud de 0,94 y kappa 0,77 frente a personas. Sin ejemplos el kappa baja a 0,58. Con eso se pueden cribar trazas. Con eso no se firma una cláusula de calidad.

Conclusión de arquitectura

Primero una condición de parada y una comprobación que conoce la tarea. Después un router o una cascada, calibrados con su muestra, no con MT Bench. Un grafo de roles solo cuando los pasos tienen herramientas distintas y el bucle se puede cortar. vLLM baja el precio del token en su GPU. No baja el número de llamadas.

3. Ejemplo: 10 500 tokens antes de que alguien diga «mal»

Práctica de ingeniería: la suma en papel, antes de comprar un framework

Un montaje que se repite cuando un «equipo de agentes» se sienta sobre un buzón de tickets (helpdesk, un modelo por API, cinco roles en serie). No es el informe de un despliegue con nombre. Es la aritmética de la sección 1.

  • Camino feliz, cinco roles, sin caché de prefijo: 10 500 tokens.
  • El mismo ticket en una llamada con herramientas (function calling: el modelo llama él mismo a una función): 1500 tokens. Razón 7.
  • Una repetición del último paso: más 2700 tokens. Nadie ha medido con qué frecuencia su crítico la va a forzar. MAST solo dice que la verificación a veces está vacía o comprueba lo que no toca.
  • El reloj, a 2 segundos por llamada y sin paralelismo: 10 segundos frente a 2 segundos. El p99 del usuario ve la suma.

Un corte que conserva la comprobación: una llamada a un modelo barato, un umbral de aceptación, el modelo caro solo tras un rechazo. Eso es la cascada de FrugalGPT, no un quinto rol llamado «senior». El umbral se toma de sus propios tickets. El 98,3% de HEADLINES pertenece a ese conjunto y a un par de modelos de 2023.

Los números de los artículos no pasan 1:1 a su factura de API. El corte sí: primero el número de llamadas, luego si el verificador sabe decir «mal», luego el precio del token. Empezar por vLLM sobre un grafo de cinco roles empaqueta el mismo bucle más barato.

4. Tabla de decisión: qué llamar y qué no automatizar

Enfoque Complejidad Latencia p99 Coste de inferencia Carga para el equipo Cuándo
Una llamada y herramientas Baja Una llamada El más bajo de la aritmética de arriba (1500 tokens) Baja, mientras el esquema de salida sea estricto Clasificación, extracción, JSON. Hay esquema o regla
Router: modelo fuerte o débil Media Una llamada pequeña, a veces una segunda RouteLLM: más de 2× en el resumen. Hasta 85% y 95% de la calidad de GPT-4 en MT Bench, en el README Hay que calibrar el umbral con su tráfico Tráfico mixto y un conjunto de evaluación, no una demo
Cascada con verificador Media Una suma, hasta que el verificador acepta FrugalGPT: 59,2%, 73,3% o 98,3%, según el conjunto Un verificador que conoce la tarea Hay una comprobación automática: test, esquema, regla
Grafo de varios roles Alta Suma de pasos. Cola si hay repetición Crece con el contexto añadido. En la aritmética de arriba, 7× frente a una llamada Traza, límite de pasos, conjunto de eval Los pasos tienen herramientas distintas y se pueden parar
Servidor propio (vLLM) Alta Depende de la cola, no del número de roles Token más barato. El mismo número de llamadas. Rendimiento 2–4× en el montaje de Kwon de 2023 Una GPU y una guardia Mucho volumen, o datos que no pueden ir a una API ajena

AI / LLM / RAG (retrieval-augmented generation, respuesta apoyada en documentos recuperados): tarifa del especialista 180–250 PLN/h, tarifa del cliente 240–350 PLN/h. Unos 35–50% más que Python de backend corriente. Margen del proveedor en un modelo abierto: 10–25%. Un mapa de mercado, no una oferta. Desglose: cuánto cuesta el body leasing IT en 2026. La búsqueda de documentos es otro bucle, distinto del número de llamadas del agente. El reentrenamiento del modelo es un tercero: servicios MLOps.

5. Antipatrones que el tutorial del framework no cuenta

  1. Cinco roles para clasificar un ticket. El framework está. El conjunto de evaluación no. ChatDev termina el 25,0% de las tareas ProgramDev. Una topología mejor llega al 40,6%, y los autores escriben que no basta para producción.
  2. Un crítico sin condición de parada. MAST: no hay condición de cierre, y una verificación que comprueba la compilación en lugar de la tarea. Una comprobación vacía es barata y no pilla nada. Una comprobación que siempre pide repetir añade la llamada más cara a la cola.
  3. Un porcentaje de un conjunto ajeno escrito en el contrato. El 98,3% es HEADLINES. El 85% es MT Bench y el par de modelos del README de RouteLLM. En su tráfico el umbral se calibra de nuevo. Si no, el ahorro es silencioso: la calidad baja y la API no devuelve error.
  4. Registros de prompts con datos personales en la herramienta de trazas de otro. Un contrato de encargo no sigue a un SDK que envía el texto del ticket «para depurar». La traza se queda en su proyecto.

6. Playbook: a quién contratar y en qué orden

No empiece por un quinto rol. Empiece por la pregunta de qué sujeta la factura: el número de llamadas, la falta de comprobación o el precio del token en su GPU.

  1. La API ya está, ya usa un modelo, y faltan un límite de pasos y un conjunto de evaluación. Eso es body leasing de un desarrollador LLM: una persona, su reunión diaria, su criterio de hecho (Definition of Done). Body leasing significa aquí alquilar un especialista para su equipo, normalmente por tiempo (time and materials, T&M). No vendemos un banquillo con nombre para el lunes por la mañana.
  2. Los datos no pueden ir a una API, y no existen la traza, la eval ni el servidor. Una persona no cose eso en un sprint. Un equipo: alguien de orquestación, alguien de la comprobación, alguien del servicio del modelo. Eso está más cerca del leasing de equipos IT que de «compramos a uno más de prompts». Cuándo un equipo y cuándo un rol: team leasing vs body leasing 2026.
  3. La clave de API y el repositorio no salen a un portátil. El contratista trabaja en su repositorio y con su clave. Exportar registros «para reproducir el fallo más rápido» es una colección de tickets de clientes. Cláusulas: contratos, márgenes, derechos de autor.
  4. Ramp-up. Una persona en un equipo que ya existe: primeros perfiles en días, inicio tras sus entrevistas y el contrato. Un equipo desde cero: semanas, porque se cosen permisos y la condición de parada en producción. El anuncio de «tres sénior LLM desde el lunes» es un CV o un banquillo que no tenemos.

Commoditech hace T&M y contratación fija desde Varsovia desde 2012. En la red hay más de 80 especialistas. No los tenemos parados en un banquillo. Un brief de body leasing o de contratación (honorarios de éxito, success fee del 15–25%, sin contratación no hay honorarios) también se puede dejar desde el editor, por MCP para agentes de IA (Model Context Protocol, el protocolo con el que un asistente del editor llama a herramientas). El importe del stack concreto lo calcula una persona. Las bandas están en el artículo de tarifas, no en una respuesta automática. Contacto: formulario.

FAQ

¿En qué se diferencia un router de una cascada y de un grafo de agentes?

Un router elige el modelo con una llamada pequeña y la decisión acaba ahí. Una cascada lanza un modelo barato y solo llama al caro cuando un verificador rechaza la respuesta. Un grafo de agentes añade roles y suele añadir su salida al contexto siguiente. En la aritmética de este artículo, cinco roles sin caché de prefijo son 10 500 tokens frente a 1500 de una llamada. RouteLLM y FrugalGPT bajan el coste en sus conjuntos. Un porcentaje de sus tablas no entra en un contrato sin una muestra de su tráfico.

¿El ahorro del 98% de FrugalGPT se traslada a nuestro helpdesk?

No como cifra de presupuesto. El 98,3% es el conjunto HEADLINES, coste 33,1 frente a 0,6, con calidad de GPT-4. OVERRULING da un 73,3%, COQA un 59,2%, y ahí la base es GPT-3. Los autores hablan de un rango del 50% al 98%. En HEADLINES, con un presupuesto de un quinto de GPT-4, otro punto de trabajo es alrededor de un 80% más barato y +1,5% de calidad. Una cascada necesita ejemplos etiquetados de una distribución cercana a producción. Si no, el umbral del verificador es de otro.

¿Cuánto cuesta el body leasing de un desarrollador LLM en Polonia en 2026?

En el mapa AI / LLM / RAG: especialista 180–250 PLN/h, cliente 240–350 PLN/h, unos 35–50% más que Python de backend corriente. Margen del proveedor en un modelo abierto: 10–25%. No es una oferta. El importe del brief lo calcula una persona. Detalle: tarifas 2026.

¿Cuándo una persona, cuándo un equipo, y se puede trabajar bajo NDA?

Una persona, cuando la API y el modelo ya están y faltan un límite de pasos, un umbral de router y un conjunto de evaluación. Un equipo, cuando los datos no pueden ir a una API ajena y nadie tiene servidor, traza ni comprobación. Sí, bajo un acuerdo de confidencialidad (NDA): el contratista trabaja en su repositorio y con su clave. Exportar registros de prompts a un portátil es una colección de tickets. Cláusulas: contratos, márgenes, derechos de autor.

Fuentes

  • Cemri, M., Pan, M. Z., Yang, S. y otros (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657. arxiv.org/abs/2503.13657. Las cifras de la tabla 4 salen de la versión de marzo de 2025.
  • Chen, L., Zaharia, M., Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176. arxiv.org/abs/2305.05176.
  • Ong, I. y otros (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665. arxiv.org/abs/2406.18665. El 85% / 95% de calidad de GPT-4 en MT Bench es el README del proyecto lm-sys, no el resumen (el resumen habla de bajar el coste más de 2×).
  • Kwon, W., Li, Z. y otros (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023, arXiv:2309.06180. arxiv.org/abs/2309.06180.
  • Commoditech — tarifas de body leasing 2026, desarrolladores LLM, team leasing vs body leasing.