gemini
Gemini adalah model bahasa besar multimodal yang dikembangkan oleh Google DeepMind, yang mendukung pemahaman dan pembuatan teks, gambar, audio, dan video, dengan konteks panjang bawaan hingga 1M–2M token. Ini menawarkan tiga tingkatan—Pro / Flash / Flash-Lite—dan mendukung pembuatan gambar (Imagen / Gemini Image).
1M–2M token jendela konteks; cache implisit (cache_read 25% dari input); cache eksplisit (dengan TTL yang dapat dikonfigurasi); pemahaman visual (gambar/video/PDF); input audio; generasi gambar (Gemini 3 Pro Image / Flash Image); Function Calling; eksekusi kode; alat Google Search; mode JSON.
Tanya Jawab Multimodal; pemahaman dan pengambilan konten video; generasi dan edit gambar; analisis dokumen panjang; generasi kode; alur kerja agen; integrasi Google Workspace.
Generasi gambar dibebankan per gambar; generasi video dibebankan per detik; tidak ada penyebaran on-premises (kecuali melalui Vertex AI); edisi enterprise memerlukan akun Google Cloud; beberapa model memerlukan mengajukan akses preview.
| Model | Input / 1M | Output / 1M | Baca cache / 1M | Per 1M |
|---|---|---|---|---|
| 1M | ||||
| 1M | ||||
| 1M | ||||
| — | — | 1M | ||
| - | 1M | |||
Gemini 3.1 Pro gemini-3.1-pro |
| $2/M$1.4/M-30% |
| $12/M$8.4/M-30% |
| $0.2/M$0.14/M-30% |
| 1M |
Gemini 3.1 Flash Lite gemini-3.1-flash-lite | $0.25/M$0.18/M-30% | $1.5/M$1.05/M-30% | $0.025/M$0.0175/M-30% | 1M |
Gemini 3 Flash gemini-3-flash | $0.5/M$0.35/M-30% | $3/M$2.1/M-30% | $0.05/M$0.035/M-30% | 1M |
Gemini 3 Pro Gambar gemini-3-pro-image | $2/image$1.4/image-30% | $12/image$8.4/image-30% | - | 1M |
Gemini Embedding 2 gemini-embedding-2 | $0.2/M$0.14/M-30% | $0/M | - | 1M |
Gemini 2.5 Flash Lite gemini-2.5-flash-lite | $0.08/M$0.06/M-30% | $0.3/M$0.21/M-30% | $0.0075/M$0.0053/M-30% | 1M |