El costo de un asistente no proviene solo de los tokens de la última llamada. Un RAG genera embeddings, busca, reordena, a veces llama a varios modelos y utiliza herramientas. Un agente puede repetir, esperar y pedir una validación humana. La infraestructura, los registros y el soporte completan el costo.
Optimizar exige medir una tarea completa y su éxito. Una solicitud barata que produce una mala respuesta y un reajuste manual es un falso ahorro.
Construir una unidad económica
Elegir una unidad relacionada con el oficio: expediente calificado, documento tratado, respuesta útil, pedido preparado o incidente resuelto. Para cada unidad, contar:
- llamadas ;
- fichas ;
- incrustaciones ;
- reclasificación ;
- herramientas;
- almacenamiento ;
- reintentos ;
- validación ;
- errores;
- infraestructura ;
- apoyo.
Esta unidad permite comparar una arquitectura, un modelo y el proceso actual.
Calcular el costo por tarea exitosa
Una fórmula simplificada es:
(coûts variables + coûts fixes affectés + validation + reprises) / tâches réussies
La tasa de éxito debe cumplir con una definición. Una respuesta mostrada no es una tarea exitosa si el usuario tiene que rehacer todo.
Los escenarios integran volumen medio, pico, crecimiento y estacionalidad. Las tarifas están fechadas y verificadas, ya que evolucionan.
Desglose del costo de una tarea de IA entre contexto, investigación, modelo, herramientas, revisiones, validación y explotación.
Evitar la llamada al modelo
La palanca más eficaz es no llamar a un LLM cuando:
- una regla es suficiente;
- una respuesta existe en caché;
- la solicitud no es válida;
- faltan los datos;
- el usuario no tiene derecho;
- una búsqueda clásica responde ;
- una operación puede ser agrupada.
La clasificación inicial puede ser determinista o usar un pequeño modelo. Los recorridos frecuentes se optimizan con prioridad.
Enrutar según la dificultad
No todas las tareas requieren el modelo más capaz. Un enrutador puede elegir:
- regla;
- modelo ligero;
- modelo especializado;
- modelo general más potente;
- trato humano.
El enrutamiento utiliza intención, longitud, riesgo, idioma y confianza. Se evalúa: un error de orientación puede costar más que el ahorro.
Para las tareas sensibles, la política y los datos pueden imponer un entorno independientemente del costo.
Reducir el contexto
Los prompts a veces acumulan historial, documentos e instrucciones. Un contexto más largo aumenta el costo y la latencia, y puede reducir la precisión.
Las palancas son:
- recuperación más precisa;
- desduplicación ;
- filtros ;
- compresión con procedencia ;
- memoria estructurada ;
- resumen de los intercambios antiguos;
- contexto diferente según la etapa;
- supresión de los ejemplos innecesarios.
La ganancia debe ser validada por las evaluaciones.
Optimizar el RAG
Una mala búsqueda lleva a enviar demasiados pasajes. Mejorar los metadatos, el híbrido y el reordenamiento puede reducir el contexto final.
Los embeddings se calculan únicamente para los contenidos cambiados. Los lotes, dimensiones y modelos se eligen según el corpus. Un cambio de embedding requiere una comparación antes de la reindexación completa.
El reranking está reservado para las consultas donde aporta una ganancia. Un pequeño número de candidatos reduce el costo.
Caché
Existen varios niveles:
- respuesta exacta;
- resultado de búsqueda ;
- incrustaciones de consulta;
- prefijo de prompt;
- salida de herramienta;
- subtarea agéntica.
La clave debe incluir versión, derechos, idioma y frescura. Una caché compartida entre usuarios no debe exponer datos privados. La invalidación sigue las fuentes y políticas.
Los proveedores pueden ofrecer mecanismos de caché de contexto; sus condiciones y ahorros son verificados.
Por lotes y asincrónico
Las tareas no interactivas pueden agruparse y procesarse con una capacidad menos costosa o en un horario adecuado. Las API por lotes eventuales tienen plazos y tarifas específicos.
La arquitectura separa las necesidades de tiempo real de los procesos en segundo plano. Un usuario recibe un estado y una notificación en lugar de una conexión mantenida innecesariamente.
Limitar los reintentos y los bucles
Un timeout no siempre significa fracaso. La idempotencia y la verificación evitan repetir una operación. Los reintentos utilizan un número máximo, un backoff y una distinción entre errores temporales y permanentes.
Los agentes tienen un presupuesto de etapas, duración y costo. Se detienen cuando no aparece ninguna nueva evidencia.
Salidas estructuradas
Un formato claro reduce las llamadas de corrección. El esquema está validado y los errores deterministas se devuelven al modelo con un número limitado de intentos.
Para una extracción, un modelo especializado o una regla de postprocesamiento puede ser más económico que una conversación general.
Modelos abiertos y capacidad privada
Una infraestructura privada puede reducir el costo variable con volumen estable, pero añade inversión y operación. Hay que calcular la tasa de utilización, la capacidad máxima, la energía, el soporte y la renovación.
Una arquitectura híbrida dirige el volumen previsible hacia una capacidad reservada y los picos o tareas complejas hacia una API. La calidad y la soberanía siguen siendo restricciones.
Negociar y reservar
A gran volumen, los proveedores pueden ofrecer capacidades, compromisos o tarifas adaptadas. Una reserva solo es rentable si el uso es estable y se acepta la dependencia.
El contrato debe tratar sobre versiones, disponibilidad, región, reversibilidad y evolución de los precios. La negociación no sustituye la optimización técnica.
Reducir los costos de validación
La interfaz muestra fuentes, diferencias y zonas inciertas para acelerar la revisión. Los controles deterministas filtran los errores antes del ser humano. El muestreo está adaptado al riesgo y a la calidad demostrada.
El tiempo humano se registra en el costo por tarea.
FinOps para la IA
Una práctica FinOps combina visibilidad, propiedad y optimización. Cada equipo conoce:
- uso ;
- presupuesto ;
- costo unitario ;
- modelo ;
- calidad ;
- anomalías ;
- previsión.
Etiquetas e identificadores asignan las llamadas al caso de uso. Las alertas detectan picos, bucles, cambio de contexto y desviación de la tasa de éxito.
Presupuestos y salvaguardias
Los límites existen por usuario, equipo, tarea y período. Cuando un presupuesto se acerca, el sistema puede:
- usar un modelo más ligero;
- reducir los pasos;
- pasar a asíncrono;
- solicitar una validación;
- rechazar una tarea no prioritaria.
Las decisiones arriesgadas no deben degradarse silenciosamente para ahorrar.
Medir calidad y costo juntos
Una tabla compara las versiones sobre:
- éxito;
- errores críticos;
- latencia ;
- costo;
- validación ;
- satisfacción.
La frontera de Pareto muestra las opciones que mejoran una dimensión sin degradar excesivamente las otras. La elección se hace por caso de uso.
Un enfoque continuo
Comenzar por instrumentar, identificar los tres puestos principales, probar una palanca y verificar la calidad. Las economías sostenibles suelen venir del proceso: mejor enrutamiento, menos contexto, menos rehacer y menos llamadas innecesarias.
Partitech puede instrumentar los costos, construir el enrutador, optimizar RAG y agentes y comparar los escenarios de alojamiento. El objetivo es un costo por tarea controlado con una calidad y seguridad comprobadas.
Hablemos de su proyecto
Auditar y optimizar el costo de su plataforma de IA con Partitech. Contacte a Partitech.