Google Cloud presentó Gemini agent durante el evento Gemini at Work 2026. Este agente de inteligencia artificial promete trabajar entre diversas aplicaciones desde una única interfaz, ejecutando tareas por horas o incluso días mientras coordina a otros agentes especializados.
Funciones de Gemini agent
Gemini agent combina herramientas, memoria y diferentes modelos de IA para realizar tareas con controles de gasto y permisos. El usuario solo necesita explicar lo que requiere, y el agente se encarga de organizar los pasos necesarios para completar la tarea. Entre las funciones anunciadas por Google se encuentran:
- Investigación y documentos: consultar información, organizar antecedentes y elaborar documentos.
- Creación de contenido: generar imágenes y presentaciones mediante lenguaje natural.
- Programación: escribir y ejecutar código, además de usar herramientas de desarrollo.
- Automatización: programar actividades y ejecutar acciones basadas en eventos.
- Trabajo entre aplicaciones: realizar operaciones usando diferentes servicios sin tener que reconstruir instrucciones.
- Coordinación de agentes: crear subagentes temporales para distribuir actividades que se pueden ejecutar simultáneamente.
El agente sigue operando en la nube incluso si el usuario cierra su computadora o cambia de dispositivo. Según Google, las tareas pueden continuar durante varios días y conservar su estado hasta finalizar.
Memoria y agentes colaborativos
Gemini agent conserva el contexto de las tareas en curso y reutiliza información de interacciones anteriores. Para ello utiliza cuatro tipos de memoria:
- Memoria de sesión: mantiene información relacionada con una actividad.
- Memoria semántica: organiza conocimientos obtenidos de documentos y conversaciones.
- Memoria procedimental: conserva instrucciones y métodos de trabajo reutilizables.
- Memoria episódica: registra actividades anteriores para conservar antecedentes.
Google también presentó los coworker agents, que son agentes permanentes con identidad, correo electrónico y permisos propios. Estos agentes pueden participar en conversaciones y editar documentos en Google Workspace, manteniendo una función definida entre distintas sesiones.
Integración con aplicaciones externas
Gemini agent puede funcionar en Gmail, Drive, Docs, Sheets, Slides, Chat y Calendar, utilizando la misma memoria y herramientas de su interfaz principal. Además, se integra con herramientas externas como:
- Colaboración: Microsoft Office, Teams, Slack.
- Desarrollo: Git y Jira.
- Gestión empresarial: Salesforce y ServiceNow.
- Bases de datos: BigQuery y PostgreSQL.
Las empresas pueden crear sus propias skills, instrucciones reutilizables que describen cómo realizar tareas de varios pasos, que Gemini selecciona y ejecuta según el contexto del usuario.
Modelos de IA y control de gastos
Google separó Gemini agent de los modelos de IA que procesan sus solicitudes, permitiendo el uso de distintos modelos para una misma tarea. Actualmente, integra modelos Gemini y Claude de Anthropic, con planes de incluir otras alternativas de código abierto. Smart Routing selecciona automáticamente el modelo más adecuado según su rendimiento y costo.
Desde la Cloud Billing Console, los usuarios pueden establecer un límite de gasto por proyecto. Si se alcanza ese límite, el agente pausa su trabajo hasta que se reanude manualmente.
Con funciones de análisis de datos y generación de código, Gemini agent puede trabajar con datos empresariales, facilitando tareas de ingeniería de datos e informes mediante instrucciones en lenguaje natural.
Fuente: Pisapapeles

Discussion about this post