TecnologíaOctober 9, 2026

Un sistema mira dentro de la inteligencia artificial

Goodfire vigila desde dentro a los agentes de inteligencia artificial

Fot. Martinimarcello00, Wikimedia Commons, CC BY 4.0

A2

La empresa presenta unos monitores internos que buscan detectar conductas peligrosas con un coste mucho menor.

Los agentes de inteligencia artificial pueden trabajar durante horas y hacer muchas tareas. A veces también pueden actuar de forma peligrosa. Para vigilarlos, normalmente se usa otra IA. Esta segunda IA lee todos sus pasos. El método funciona, pero puede ser lento y muy caro.

La empresa Goodfire ha presentado una opción diferente. Sus pequeños detectores observan las señales internas del modelo mientras trabaja. El sistema se parece al control de seguridad de un aeropuerto: primero hay una revisión rápida. Si aparece una señal de peligro, otra IA estudia el caso con más atención. Así no es necesario revisar a fondo cada paso.

Los clientes de Baseten pueden elegir los riesgos que quieren buscar. Entre ellos están los ataques informáticos, el uso peligroso de armas químicas o biológicas y las trampas para conseguir una recompensa. Ante un aviso, pueden guardar la información, pedir ayuda a una persona o rechazar la petición.

Goodfire probó el sistema con el modelo abierto Kimi K3. Los detectores encontraron el 93 % de las sesiones con ataques maliciosos. También enviaron a revisión el 5,5 % de las sesiones sin peligro. Según la empresa, vigilar un millón de intercambios costaría unos 185 dólares. Una IA barata que leyera todos los pasos costaría unos 5.420 dólares. Además, cuatro detectores aumentaron menos de un 2 % el tiempo de espera antes de la respuesta. La idea es descubrir el peligro antes de que el agente actúe.

Basado en: Aditya Mehta, TechCrunch