Hablemos de su proyecto
RAG y búsqueda IA

RAG agente o RAG clásico: ¿cuándo dejar que la IA planifique sus investigaciones?

Dejar que un agente reformule, busque, verifique y vuelva a empezar puede mejorar las preguntas complejas. Esto también aumenta la variabilidad, el costo y la superficie de seguridad.

RAG agente o RAG clásico: ¿cuándo dejar que la IA planifique sus investigaciones?

Un RAG clásico recibe una pregunta, recupera pasajes y luego genera una respuesta. Esta cadena es rápida, comprensible y adecuada para muchos usos documentales. Un RAG agéncico añade un bucle: el modelo analiza la pregunta, elige una fuente o una herramienta, examina el resultado, reformula y continúa hasta un criterio de parada.

Esta autonomía puede resolver cuestiones de múltiples pasos. También aumenta el número de llamadas, la variabilidad y la superficie de ataque. El objetivo no es hacer que todo RAG sea agente, sino reservar la planificación para las tareas que lo necesiten.

El RAG clásico como referencia

Una arquitectura simple comprende:

  1. normalización de la pregunta;
  2. búsqueda de texto completo, vectorial o híbrida ;
  3. filtrado de derechos;
  4. reclasificación eventual ;
  5. construcción del contexto ;
  6. generación con citas;
  7. control de formato.

Es testeable paso a paso. La latencia y el costo son previsibles. Gran parte de los problemas proviene de la calidad del corpus, del segmentado o de la búsqueda, no de la ausencia de agente.

Los límites de una investigación única

Una sola solicitud se vuelve insuficiente cuando la pregunta requiere:

  • comparar varias entidades;
  • relacionar eventos en el tiempo;
  • consultar diferentes fuentes;
  • calcular a partir de resultados;
  • resolver una ambigüedad;
  • verificar una afirmación;
  • encadenar investigación y herramienta profesional.

Una pregunta como «¿qué cláusulas han cambiado entre las dos versiones y qué impacto tienen en los expedientes abiertos?» requiere varios pasos y fuentes.

Antes del agente: las estrategias intermedias

Reformulación controlada

Una regla o un modelo produce algunas variantes, luego los resultados se fusionan. El número de llamadas permanece limitado.

Descomposición según un patrón

Para una comparación, el sistema crea una subpregunta por entidad y luego reúne las respuestas. La estructura es conocida y verificable.

Enrutamiento

Un clasificador elige el índice, el idioma o la herramienta. No planifica libremente.

Reordenamiento y contexto vecino

A veces, el pasaje pertinente ya existe entre los candidatos. Basta con mejorar la clasificación.

Estas técnicas ofrecen parte de los beneficios con menos variabilidad.

Lo que añade un RAG agéntico

Un agente mantiene un estado de búsqueda, elige una próxima acción y evalúa si la información es suficiente. Puede:

  • solicitar una aclaración;
  • seleccionar una fuente;
  • generar una consulta;
  • llamar a una API;
  • leer un resultado;
  • detectar una laguna;
  • verificar una afirmación;
  • sintetizar con procedencia.

Las acciones deben permanecer en un catálogo limitado y el plan nunca es una autorización.

Los criterios que justifican un bucle agéntico

Variabilidad del camino

Las preguntas requieren diferentes pasos que no se pueden codificar simplemente.

Múltiples fuentes

Documentos, base, web autorizado y herramientas de negocio deben estar coordinados.

Verificación posible

El sistema puede controlar una suma, una cita, una coherencia o la presencia de una prueba.

Valor suficiente

La ganancia en las cuestiones complejas compensa la latencia y el costo.

Tolerancia a la incertidumbre

El resultado es revisado o utilizado en una decisión cuyos controles son adecuados.

Juego de evaluación

Casos multi-etapa permiten medir si el bucle realmente aporta una mejora.

Cuatro niveles de RAG, desde la recuperación única hasta la búsqueda agente iterativa con verificación.

Diseñar el plan como un estado explícito

El plan no debe existir únicamente en un texto oculto. El sistema conserva etapas estructuradas: objetivo, acción, parámetros, resultado, prueba, estado y próxima decisión.

Esta representación permite:

  • limitación del número de etapas;
  • reanudación;
  • visualización al usuario;
  • auditoría ;
  • comparación ;
  • interrupción.

Los razonamientos privados del modelo no son necesarios. Basta con conservar decisiones operativas y justificaciones cortas.

Elegir herramientas limitadas

Una herramienta de búsqueda recibe una consulta, filtros y un número máximo. Un calculador ejecuta una operación definida. Un acceso de negocio respeta los derechos. El agente no recibe un shell, un SQL o un navegador ilimitado.

Cada herramienta devuelve datos estructurados, una procedencia y los errores. Los resultados se consideran no fiables hasta su validación.

Definir los criterios de parada

Un bucle sin límite puede continuar buscando, consumiendo y acumulando ruido. Los criterios incluyen:

  • número máximo de pasos;
  • presupuesto de tokens o costo;
  • duración;
  • pruebas suficientes;
  • ausencia de nueva información;
  • confianza mínima;
  • necesidad de aclaración;
  • acción prohibida.

Cuando el criterio no se cumple, el sistema produce una respuesta parcial o una negativa explícita.

Verificar en lugar de auto-convencerse

Preguntar al mismo modelo si está satisfecho no constituye una prueba. Las verificaciones útiles son externas: referencias existentes, cálculo, esquema, restricciones de negocio, segundo método de investigación o revisión humana.

Un modelo puede desempeñar un papel crítico, pero sus veredictos están calibrados en casos humanos y no reemplazan los controles deterministas.

Gestionar las citas de múltiples pasos

Cada afirmación final debe estar vinculada a los pasajes y resultados que la respaldan. El sistema conserva la procedencia en cada paso y evita que un resumen intermedio pierda las referencias.

Cuando un cálculo utiliza varias fuentes, mostrar las entradas, las versiones y la fórmula. Se señalizan las contradicciones.

Seguridad

El bucle aumenta la exposición a la inyección de prompts: cada documento y respuesta de herramienta puede intentar influir en el plan. Los datos permanecen separados de las políticas. Las herramientas y destinos son controlados por una capa independiente.

El contexto de cada etapa es mínimo. Los secretos nunca son accesibles para el modelo. Las llamadas web o de código se ejecutan en un entorno aislado.

Latencia y experiencia del usuario

Una búsqueda agentica puede tomar varios segundos o minutos. La interfaz muestra el estado útil: fuentes en curso, etapa, posibilidad de cancelar y resultado parcial. No muestra un pseudo-razonamiento teatral.

Las tareas largas pueden ser asincrónicas, con notificación y reanudación. Una caché reutiliza los subresultados estables cuando los derechos y la frescura lo permiten.

Costo

El costo varía con el número de etapas, de consultas, de tokens y de reordenamientos. Un presupuesto por tarea y un modelo de enrutamiento evitan los bucles costosos.

Las preguntas simples deben tomar el camino directo. Un clasificador o reglas pueden reservar al agente para las intenciones complejas.

Evaluar la aportación

Comparar el RAG agente con una línea base fuerte, no con un prototipo débil. Medir:

  • tasa de respuesta correcta;
  • cobertura de pruebas;
  • calidad de las negativas;
  • número de etapas ;
  • latencia ;
  • costo;
  • estabilidad ;
  • errores de herramienta;
  • satisfacción.

El análisis por tipo de pregunta revela dónde el agente es útil y dónde empeora la experiencia.

Desplegar progresivamente

Comenzar en modo observación: el agente propone un plan sin actuar, luego comparar con el método actual. Activar después algunas herramientas en lectura, presupuestos estrictos y una revisión humana.

Los casos fallidos alimentan la secuencia de evaluación. Los límites se aumentan solo si las ganancias están demostradas.

La simplicidad como arquitectura por defecto

Un RAG clásico bien diseñado sigue siendo la mejor opción para una base de conocimientos y preguntas directas. La búsqueda agente se vuelve relevante cuando la tarea realmente requiere una exploración variable y verificable.

Partitech puede construir una línea base RAG, diseñar los bucles de búsqueda, asegurar las herramientas e implementar las evaluaciones comparativas. El objetivo es añadir autonomía únicamente donde mejore la calidad útil.

Hablemos de su proyecto

Evaluar el interés de un agente RAG en sus casos reales con Partitech. Contacte a Partitech.

Compartir este artículo