Google presenta Gemini Robotics ER 2, un cerebro de alto nivel para robots que les permite razonar en tiempo real, conversar con humanos y planificar tareas de varios pasos. ¿La idea? Que los robots no solo entiendan el espacio, sino que piensen rápido y actúen sin pausas torpes entre pensamiento y movimiento.
Qué es Gemini Robotics ER 2
Gemini Robotics ER 2 es un modelo de "embodied reasoning" diseñado para orquestar el trabajo de robots en entornos reales. Piensa en él como el director de una orquesta: toma decisiones de alto nivel, coordina sensores y modelos de baja latencia, y delega la ejecución motora a sistemas especializados como modelos Vision-Language-Action (VLA) o APIs de navegación.
No es solo teoría. Google mostró demos prácticas, por ejemplo usando a Spot de Boston Dynamics para que busque y traiga una palomita con una instrucción en lenguaje natural. Esos ejemplos están disponibles en GitHub para quien quiera probarlos.
Mejoras clave frente a la versión anterior
Gemini Robotics ER 2 mejora aspectos críticos para operar en el mundo físico:
- Observa video continuo para seguir el progreso de una tarea y corregir errores sin reiniciar.
- Coordina múltiples robots en el mismo espacio para completar flujos de trabajo complejos.
- Se integra con
Gemini Live APIy ofrece un endpoint de streaming bidireccional optimizado para tareas con requerimiento de baja latencia.
Esto evita el molesto efecto de "parar a pensar": el modelo puede planear lo que sigue mientras el robot actúa.
Inteligencia temporal y seguimiento del progreso
Una pregunta clave en robótica es: ¿cómo sabe un robot que una tarea está realmente terminada? Gemini Robotics ER 2 introduce dos capacidades prácticas:
-
Clasificación de progreso: asigna cada cuadro de video a niveles de avance (0-20%, 20-40%, etc.). En evaluaciones, alcanza 57.4% de precisión en esta tarea, lo que le da conciencia situacional para ajustar o repetir pasos.
-
Moment-finding: localiza el cuadro exacto donde ocurre un evento crítico, por ejemplo el momento en que se deja de ver líquido al verter. Aquí alcanza 91.3% de precisión y 0.96 segundos de distancia media absoluta, con cuatro veces la velocidad de ejecución respecto a generaciones previas. Eso significa decisiones en menos de un segundo, algo imprescindible para operar con seguridad.
Colaboración entre robots
No todos los robots son iguales. Una rueda se mueve mejor en pisos lisos, un brazo humanoide en terrenos irregulares. ER 2 permite que distintos robots compartan una comprensión semántica y hagan handoffs de tareas. Google muestra cómo máquinas de Apptronik y Franka trabajan juntas para resolver tareas que un solo robot no podría completar.
Mejora de la inteligencia espacial
ER 2 también refuerza capacidades de razonamiento espacial en tres áreas:
- Detección de éxito o falla usando video continuo para atrapar incidentes en tiempo real.
- Lectura generalizada de instrumentos: desde diales circulares hasta pantallas digitales y termómetros de líquido.
- Mejora en Visual Question Answering espacial para preguntas sobre la escena.
En conjunto, el modelo consigue las mejores puntuaciones en varios benchmarks internos de Google en detección de éxito, lectura de instrumentos y preguntas visuales.
Seguridad y restricciones físicas
La seguridad es central. ER 2 mejora en seguir instrucciones de seguridad y detectar la proximidad humana. En pruebas, detiene a un robot humanoide cuando una persona se acerca y solo retoma la tarea cuando el área es segura. Google también introduce un nuevo benchmark para evaluar la capacidad de un modelo de coordinación a aplicar restricciones físicas, monitorear el entorno y pedir clarificación humana cuando sea necesario.
Disponibilidad y cómo empezar
Gemini Robotics ER 2 está disponible para desarrolladores a través de la Gemini API, Google AI Studio y en preview privada en Gemini Enterprise Agent Platform. Google publica ejemplos y configuraciones para ayudar a integrar el modelo con VLAs, APIs de navegación y sistemas de teleoperación.
Si trabajas en robótica o quieres experimentar, esta liberación te ofrece un punto de entrada para construir agentes físicos más fiables y rápidos.
Qué significa esto para el futuro cercano
No es una promesa lejana: esta generación muestra mejoras prácticas en temporalidad, seguridad y colaboración entre máquinas. Ver robots que entienden cuándo un paso está completo, que corrigen errores en tiempo real y que pueden trabajar en conjunto abre posibilidades reales en logística, manufactura ligera, inspección y asistencia personal.
¿Significa que todo se automatiza mañana? No exactamente. Pero sí reduce barreras técnicas importantes y hace más accesible que equipos multidisciplinares construyan soluciones robóticas útiles hoy.
Fuente original
https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2
