En SmartBytes analizamos las claves de esta novedad tecnológica.
Google DeepMind ha presentado Gemini Robotics ER 2, un avanzado modelo de inteligencia artificial diseñado para optimizar la interpretación y coordinación de tareas físicas en entornos robóticos. Este sistema, basado en Gemini 3.5 Flash, procesa múltiples tipos de datos como texto, imágenes, vídeo y audio para planificar actividades complejas y supervisar su ejecución mediante la delegación a sistemas de control robótico especializados.
Una característica destacada de Gemini Robotics ER 2 es su capacidad para analizar secuencias continuas de vídeo, lo que le permite evaluar el progreso de una tarea en tiempo real, detectar fallos y ajustar planes de acción de forma dinámica. En pruebas internas, Google reporta una precisión del 57,4 % en la clasificación del avance de actividades y un 91,3 % en la localización temporal de eventos dentro de vídeos, aunque estos resultados aún no han sido validados de forma independiente.
Además, el modelo facilita la coordinación entre múltiples robots con diferentes habilidades y formas, al compartir una representación semántica común de las tareas y distribuir responsabilidades u objetos entre ellos. Ejemplos demostrativos incluyen la integración con el humanoide Apollo 2 de Apptronik, el sistema Franka F3 Duo y el robot Spot de Boston Dynamics, donde Gemini Robotics ER 2 gestiona instrucciones en lenguaje natural y controla interfaces específicas de cada plataforma.
Para desarrolladores, Gemini Robotics ER 2 está disponible en vista previa a través de Gemini API y Google AI Studio, con variantes que soportan desde interacciones convencionales hasta aplicaciones con transmisión bidireccional de baja latencia. La solución admite un contexto de entrada multimodal de hasta 131.072 tokens y ofrece salidas en texto estructurado, incluyendo llamadas a funciones para integrarse con sistemas robóticos existentes.
Es importante destacar que, aunque Gemini Robotics ER 2 incorpora evaluaciones para detectar personas y manejar situaciones de riesgo, estas pruebas se enfocan en el razonamiento de alto nivel y no reemplazan las arquitecturas de seguridad funcionales ni las certificaciones requeridas para la operación física segura de robots. Por tanto, su implementación en entornos productivos deberá considerar integraciones específicas, mecanismos de protección deterministas y cumplimiento normativo riguroso.