Google incorporó la función computer use directamente en Gemini 3.5 Flash. La herramienta permite que agentes de IA observen interfaces, razonen sobre una tarea y ejecuten acciones en navegadores, dispositivos móviles y computadoras de escritorio.
Hasta ahora, esta capacidad estaba disponible como un modelo independiente basado en Gemini 2.5. Al integrarla en la versión principal de Flash, los desarrolladores pueden crear agentes más completos sin tener que combinar modelos separados para conversar, usar herramientas y operar interfaces gráficas.
Qué puede hacer Gemini 3.5 Flash
Gemini ya contaba con capacidades como function calling, búsqueda y consultas fundamentadas en Google Maps. Con computer use, el modelo también puede interactuar con aplicaciones que no necesariamente ofrecen una API directa.
En la práctica, esto permite automatizar tareas como:
- Probar continuamente una aplicación desde la perspectiva de un usuario.
- Navegar por plataformas empresariales y recopilar información.
- Completar flujos de trabajo en aplicaciones profesionales.
- Ejecutar procesos de varios pasos en navegadores, móviles y escritorios.
- Coordinar acciones entre distintas herramientas digitales.
La diferencia importante está en la duración y complejidad de las tareas. Un agente no solo responde una pregunta: puede analizar el estado de una interfaz, decidir cuál es el siguiente paso, realizar una acción y verificar el resultado.
La meta es pasar de asistentes que generan texto a agentes capaces de trabajar dentro de los entornos digitales donde ya operan las personas.
Seguridad frente a las inyecciones de instrucciones
Dar acceso a una interfaz también introduce riesgos. Una página web, un correo o un documento podría contener instrucciones ocultas diseñadas para engañar al agente. Este tipo de amenaza se conoce como prompt injection indirecta.
Para reducir ese riesgo, Google afirma que aplicó entrenamiento adversarial específico para las tareas de computer use en Gemini 3.5 Flash. El objetivo es que el modelo identifique mejor los intentos de manipulación mientras opera en entornos reales.
Además, la compañía presenta dos sistemas opcionales de protección para empresas:
- Exigir confirmación explícita del usuario antes de acciones sensibles o irreversibles.
- Detener automáticamente la tarea cuando se detecte una posible inyección indirecta de instrucciones.
Estas medidas no sustituyen una arquitectura de seguridad completa. Google recomienda combinarlas con entornos aislados, revisión humana, controles estrictos de acceso y mecanismos de verificación antes de ejecutar acciones críticas.
Por qué importa para los desarrolladores
La integración nativa puede simplificar el diseño de agentes. En lugar de construir una arquitectura que separe el razonamiento, el uso de herramientas y la interacción con interfaces, los equipos pueden trabajar con un modelo Flash que reúna esas capacidades en un mismo flujo.
Esto resulta especialmente relevante para automatización empresarial, pruebas de software y tareas de conocimiento. Por ejemplo, un agente podría revisar una aplicación, detectar un comportamiento inesperado, documentarlo y escalarlo para revisión humana.
Aun así, el acceso a una computadora no convierte automáticamente al agente en un trabajador autónomo confiable. Las aplicaciones pueden cambiar su diseño, los datos pueden ser ambiguos y una acción equivocada puede tener consecuencias reales. Por eso, los permisos limitados y la supervisión siguen siendo esenciales.
Cómo empezar a probarlo
Google indica que los desarrolladores pueden probar la función en un entorno de demostración alojado por Browserbase. También pueden consultar una implementación de referencia y la documentación correspondiente para Gemini API y Gemini Enterprise Agent Platform.
El lanzamiento muestra una dirección clara para los agentes de IA: ya no se trata únicamente de responder desde una ventana de chat, sino de operar con criterio dentro de las herramientas que usamos todos los días. La pregunta ahora no es si estos sistemas podrán hacer más cosas, sino cómo diseñarlos para que sepan cuándo actuar, cuándo pedir permiso y cuándo detenerse.
