TwelveLabs presenta una herramienta que organiza vídeos en primera persona para facilitar el aprendizaje de los robots.
TwelveLabs ha lanzado Pegasus 1.6, un modelo de inteligencia artificial que convierte vídeo sin procesar en datos estructurados. Su avance principal está en las grabaciones egocéntricas, captadas desde la perspectiva de una persona o una máquina mientras realiza una tarea. Una cámara llevada por un operario puede registrar así el orden de sus movimientos y el uso de cada mano.
El sistema divide el vídeo en acciones, asigna marcas de tiempo y genera descripciones según las categorías elegidas por el cliente. También revisa tomas inestables u obstruidas, localiza duplicados y señala escenas anómalas o material sensible. La versión 1.6 incorpora además el análisis de imágenes fijas y mejora el reconocimiento de personas y objetos.
La propuesta intenta reducir uno de los costes menos visibles de la robótica: preparar demostraciones adecuadas para entrenar modelos. La teleoperación proporciona ejemplos valiosos, pero requiere un robot, equipamiento específico y personal cualificado. En cambio, los vídeos de trabajadores podrían ampliar el conjunto de datos sin reproducir cada tarea con una máquina durante la grabación.
Pegasus aporta descripciones y orden, pero no instrucciones de movimiento. Para actuar con precisión, un robot todavía necesita datos sobre el contacto, la presión y la trayectoria, además de sistemas de control. TwelveLabs cobra una tarifa base de 1,75 dólares por hora de vídeo, a la que se añaden otros cargos. La utilidad real dependerá de la precisión de las etiquetas, de las correcciones humanas necesarias y de su efecto en el aprendizaje de tareas concretas.
Basado en: Carl Franzen, VentureBeat
