gemini
Gemini es el modelo de lenguaje grande multimodal desarrollado por Google DeepMind, que soporta la comprensión y generación de texto, imágenes, audio y video, con un contexto nativo de 1M–2M tokens. Ofrece tres niveles—Pro / Flash / Flash-Lite—y soporta la generación de imágenes (Imagen / Gemini Image).
Ventana de contexto de 1M a 2M tokens; caché implícito (cache_read 25% de la entrada); caché explícito (con TTL configurable); comprensión visual (imágenes/video/PDF); entrada de audio; generación de imágenes (Gemini 3 Pro Image / Flash Image); Function Calling; ejecución de código; herramienta Google Search; modo JSON.
Consultas y respuestas multimodales; comprensión y recuperación de contenido de video; generación y edición de imágenes; análisis de documentos largos; generación de código; flujos de trabajo de agentes; integración con Google Workspace.
La generación de imágenes se cobra por imagen; la generación de vídeo se cobra por segundo; no hay despliegue on-premises (excepto a través de Vertex AI); la edición empresarial requiere una cuenta de Google Cloud; algunos modelos requieren solicitar acceso previo.
| Modelo | Entrada / 1M | Salida / 1M | Lectura caché / 1M | Por 1M |
|---|---|---|---|---|
| 1M | ||||
| 1M | ||||
| 1M | ||||
| — | — | 1M | ||
| - | 1M | |||
Gemini 3.1 Pro gemini-3.1-pro |
| $2/M$1.4/M-30% |
| $12/M$8.4/M-30% |
| $0.2/M$0.14/M-30% |
| 1M |
Gemini 3.1 Flash Lite gemini-3.1-flash-lite | $0.25/M$0.18/M-30% | $1.5/M$1.05/M-30% | $0.025/M$0.0175/M-30% | 1M |
Gemini 3 Flash gemini-3-flash | $0.5/M$0.35/M-30% | $3/M$2.1/M-30% | $0.05/M$0.035/M-30% | 1M |
Gemini 3 Pro Imagen gemini-3-pro-image | $2/image$1.4/image-30% | $12/image$8.4/image-30% | - | 1M |
Gemini Embedding 2 gemini-embedding-2 | $0.2/M$0.14/M-30% | $0/M | - | 1M |
Gemini 2.5 Flash Lite gemini-2.5-flash-lite | $0.08/M$0.06/M-30% | $0.3/M$0.21/M-30% | $0.0075/M$0.0053/M-30% | 1M |