TestMu AI presentó Agent Assurance para validar agentes de IA antes del despliegue
El nuevo producto apunta a evaluar agentes conversacionales y autónomos con pruebas derivadas del código fuente, ejecutadas en condiciones reales y con un indicador de “brecha de garantía” para lo no verificable, una métrica que busca ordenar decisiones de ingeniería en equipos que implementan automatización basada en inteligencia artificial

Agent Assurance es el nuevo producto de TestMu AI (antes LambdaTest) orientado a verificar agentes de inteligencia artificial antes de su envío. La propuesta se enfoca en una pregunta operativa para los equipos de ingeniería que ponen estos sistemas en producción: si el agente puede desplegarse con seguridad.
La plataforma reúne en un mismo esquema dos categorías. Por un lado, Conversational Agent, destinada a agentes que interactúan con personas a través de chat, voz, teléfono, video e imágenes. Por otro, Autonomous Agent, enfocada en agentes que operan sobre sistemas y pueden utilizar herramientas, crear archivos, acceder a API y abrir solicitudes de incorporación de cambios.
El enfoque de evaluación busca correrse de la validación basada en el “relato” del propio agente —como una transcripción o la puntuación de un juez sobre el mensaje final— para concentrarse en el efecto observado. A partir del código fuente, el producto analiza el funcionamiento del agente y genera un conjunto de pruebas de extremo a extremo que abarca pruebas funcionales, comprobaciones no funcionales y escenarios adversos. Luego ejecuta el agente en condiciones reales y evalúa cada criterio con datos observados, como archivos modificados en disco, artefactos generados y llamadas a herramientas verificadas contra la superficie de herramientas declarada por el agente.
Además de los veredictos “aprobado” y “fallido”, Agent Assurance incorpora un tercero: “no se pudo verificar”. Ese resultado se excluye de la tasa de aprobados y se publica como un número denominado “brecha de garantía”, que busca reflejar qué parte del comportamiento no pudo comprobarse. En ese marco, el producto vincula cada resultado de un informe con algo efectivamente observado y plantea que la brecha puede reducirse al hacer que los agentes sean más observables.
“Los equipos de ingeniería están acumulando una deuda de validación precisamente en el nivel en el que más está en juego”, dijo Vipul Verma, vicepresidente sénior de ingeniería del grupo TestMu AI. “Agent Assurance informa de la tasa de aprobados y del tamaño de su propio punto ciego”, agregó.
Entre las capacidades enumeradas, el producto propone generar pruebas sin escribirlas manualmente, con un conjunto derivado del código fuente y con la única entrada de cómo invocar al agente (por comando, punto final HTTP, servidor MCP o un flujo de trabajo creado en plataformas como n8n). También incorpora por defecto escenarios adversariales, con familias de pruebas para inyección de instrucciones, uso indebido de herramientas y anulación de instrucciones.
La herramienta se integra a flujos de integración continua (CI) con comandos sin interfaz gráfica y códigos de salida que distinguen entre fallas del agente y límites del entorno de prueba. Además, incluye pruebas de regresión con comparativas entre ejecuciones para diferenciar resultados que fallan por primera vez, los que se corrigieron recientemente y los inestables.
En Conversational Agent, la plataforma sumó Video Agent Testing, una capacidad en la que un humano simulado con rostro y voz realistas se une a una sesión en vivo por video, conversa y califica al agente según criterios definidos por el equipo, con veredictos vinculados al momento exacto de la grabación. En ese modo, lo no verificable se considera “no cumplido”. Conversational Agent ya se encuentra disponible de forma generalizada, mientras que Autonomous Agent está en acceso anticipado y se ejecuta desde el terminal como “rook”.
- Etiquetas
- TestMu AI
- Agent Assurance
- Vipul Verma
Artículos relacionados

Guide lanzó MobIR 3.0, cámara térmica de doble visión para smartphones iOS y Android
La compañía presentó una nueva serie de cámaras térmicas móviles con tecnología ApexVision Ultra-Clarity y tres modelos, con rango de medición de -20 °C a 550 °C y arranque en cinco segundos, orientada a inspecciones termográficas en edificios, sistemas eléctricos, vehículos y tareas al aire libre

Thomson Reuters integra CoCounsel en HighQ y suma IA generativa al trabajo legal
La compañía incorporó su tecnología de inteligencia artificial dentro de la plataforma de colaboración y gestión legal para acelerar contratos, *due diligence* y notificaciones regulatorias en América Latina, con foco en trazabilidad y control, en un contexto de mayor presión regulatoria para los equipos legales en Argentina

Quishing: ESET alerta por el uso de códigos QR en correos corporativos maliciosos
La modalidad de phishing basada en códigos QR busca comprometer credenciales y datos confidenciales y, según el ESET Threat Report H1 2026, ya estuvo presente en el 11% de los correos de phishing detectados en la primera mitad de 2026, un dato que obliga a revisar capacitación, procesos y controles técnicos en empresas

