Productos FTTH

Tienda FFTH desde 2004

Entradas Mensuales

Síguenos en:

Canal Oficial Telegram de elhacker.NET Grupo Facebook elhacker.NET Twitter elhacker.NET Canal Youtube elhacker.NET Comunidad Steam: Grupo elhacker.NET Mastodon

Entradas populares

PostHeaderIcon Gemini Robotics ER 2: cerebro robótico avanzado


Google DeepMind ha presentado Gemini Robotics ER 2, un nuevo modelo de IA diseñado como cerebro de alto nivel para optimizar la robótica actual.




  • Google DeepMind, la división de IA de Alphabet, ha revelado el Gemini Robotics ER 2. Se trata de una evolución en sus modelos de inteligencia artificial que funciona como un cerebro de alto nivel para sistemas robóticos, con el objetivo principal de solventar las limitaciones actuales en el campo de la robótica.



Google DeepMind, el laboratorio de investigación avanzada de inteligencia artificial de Alphabet, ha presentado el Gemini Robotics ER 2. Hablamos de una nueva versión de su modelo de inteligencia artificial diseñado para actuar como el cerebro de alto nivel de un robot. La propuesta busca superar uno de los grandes problemas de la robótica actual: no basta con que una máquina reconozca objetos o ejecute movimientos, sino que debe comprender lo que está ocurriendo, conversar con una persona, planificar tareas compuestas por numerosos pasos y reaccionar rápidamente cuando cambia el entorno.

La principal novedad es que Gemini Robotics ER 2 puede razonar sobre lo que debe hacer mientras el robot todavía está ejecutando una acción anterior. También observa continuamente las cámaras de la máquina para comprobar su progreso, detectar errores y decidir cuándo una fase ha terminado realmente. Google pretende así eliminar las incómodas pausas en las que un robot se queda inmóvil mientras procesa la siguiente orden, acercándolo a un comportamiento mucho más humano.

Gemini Robotics ER 2 actúa como un cerebro que coordina el cuerpo del robot

Gemini Robotics ER 2 no controla directamente cada motor, articulación o movimiento. En su lugar, se coloca por encima de los sistemas de control tradicionales y organiza el trabajo de los modelos de visión-lenguaje-acción, sistemas de navegación y otras API robóticas. El modelo interpreta las instrucciones, divide una tarea compleja en diferentes fases y delega su ejecución al controlador más adecuado. Esto permite utilizar la misma inteligencia de alto nivel con robots de diseños y fabricantes distintos.

Los desarrolladores pueden declarar estas interfaces de control como herramientas disponibles para Gemini, del mismo modo que un agente de IA puede utilizar una calculadora, consultar una base de datos o ejecutar una función. Gemini Robotics ER 2 también puede recurrir de forma nativa a la Búsqueda de Google o a funciones creadas específicamente por el programador. Un robot podría, por ejemplo, buscar información sobre un producto, identificarlo mediante sus cámaras, localizarlo en una habitación y ordenar al sistema de movimiento que lo recoja.

Para reducir la latencia, el modelo se integra con la API de Gemini Live, utilizando una conexión bidireccional mediante la que recibe vídeo, audio y texto mientras envía órdenes continuamente a los sistemas del robot. Google asegura que esta arquitectura evita el clásico funcionamiento de “parar, pensar y continuar”. La compañía lo ha demostrado con Spot, el robot cuadrúpedo de Boston Dynamics, al que Gemini Robotics ER 2 puede ordenar que navegue por un espacio, localice un objeto y lo recoja mediante su brazo robótico a partir de una petición expresada en lenguaje natural.

Los robots pueden corregir errores o colaborar ante una persona

Google DeepMind - Gemini Robotics ER 2

Otra mejora fundamental es la capacidad de analizar un flujo de vídeo continuo para saber cuánto ha avanzado una tarea. Gemini Robotics ER 2 es capaz de clasificar cada fotograma dentro de cinco niveles de progreso, desde el 0-20% hasta el 80-100%. En las pruebas realizadas por Google alcanzó una precisión del 57,4% en esta clasificación, lo que permite al robot detectar que una acción no está funcionando, repetir únicamente el paso afectado y continuar sin reiniciar todo el proceso desde el principio.

El modelo también puede localizar el momento exacto en el que sucede un evento relevante, como cuándo una taza está suficientemente llena o cuándo se ha terminado de cerrar una bolsa. En estas pruebas obtuvo un 91,3% de precisión, con una desviación media de 0,96 segundos. Según Google, ofrece esta capacidad con una velocidad de ejecución cuatro veces superior a la de modelos de lenguaje mucho más grandes y utilizando solo una fracción de sus recursos computacionales, algo especialmente importante cuando una decisión tardía podría provocar un derrame, una colisión o un movimiento peligroso.

Gemini Robotics ER 2 introduce además la colaboración entre robots diferentes mediante una comprensión semántica compartida. Google mostró al Franka F3 Duo colocando objetos dentro de cajas mientras el humanoide Apollo 2 de Apptronik recogía esas cajas y las colocaba en una estantería. A ello se le suman mejoras de seguridad: el modelo puede reconocer que una persona ha entrado en el área de trabajo, detener automáticamente al robot y reanudar la actividad cuando el espacio vuelve a estar despejado. Gemini Robotics ER 2 ya está disponible para desarrolladores mediante la API de Gemini y Google AI Studio, mientras que su integración en Gemini Enterprise Agent Platform permanece en vista previa privada.




Fuentes:
https://elchapuzasinformatico.com/2026/08/gemini-robotics-er-2-cerebro-de-alto-nivel-para-robots/

0 comentarios :

Publicar un comentario

Los comentarios pueden ser revisados en cualquier momento por los moderadores.

Serán publicados aquellos que cumplan las siguientes condiciones:
- Comentario acorde al contenido del post.
- Prohibido mensajes de tipo SPAM.
- Evite incluir links innecesarios en su comentario.
- Contenidos ofensivos, amenazas e insultos no serán permitidos.

Debe saber que los comentarios de los lectores no reflejan necesariamente la opinión del STAFF.