TecnologíaOctober 9, 2026

Goodfire examina las señales internas de la IA para anticipar riesgos

Goodfire vigila desde dentro a los agentes de inteligencia artificial

Fot. Martinimarcello00, Wikimedia Commons, CC BY 4.0

B2

La empresa presenta unos monitores internos que buscan detectar conductas peligrosas con un coste mucho menor.

La forma más habitual de supervisar a un agente de inteligencia artificial consiste en pedir a un segundo modelo que revise todo su trabajo. Este mecanismo puede resultar caro cuando el agente opera durante horas y genera el equivalente a varias novelas. Goodfire propone observar, en cambio, los cálculos internos que el modelo ya realiza.

Su sistema utiliza pequeñas sondas que analizan las activaciones internas en cada etapa. La empresa lo compara con la seguridad de un aeropuerto: un control rápido examina a todo el mundo y una inspección más profunda solo se pone en marcha ante una alerta. De este modo, otra IA interviene únicamente cuando las señales apuntan a una conducta sospechosa.

Los clientes de la plataforma Baseten pueden seleccionar riesgos como la piratería ofensiva, el uso indebido de armas químicas o biológicas y la manipulación de recompensas. También deciden si el sistema registra el suceso, solicita una revisión humana o rechaza directamente la petición.

En ensayos con el modelo abierto Kimi K3, las sondas identificaron el 93 % de las sesiones de piratería maliciosa. A la vez, enviaron a revisión el 5,5 % de las sesiones inofensivas. Goodfire calcula que supervisar un millón de intercambios costaría unos 185 dólares, frente a 5.420 con un modelo económico que examinara cada paso y cerca de 200.000 con uno de primer nivel. Cuatro sondas, además, añadieron menos de un 2 % al tiempo previo a la respuesta. La propuesta se dirige especialmente a modelos abiertos, cuyas protecciones pueden retirarse, y busca detectar una intención peligrosa antes de que se convierta en una acción.

Basado en: Aditya Mehta, TechCrunch