gpt-4o · OpenAI · vision
GPT-4o es el modelo multimodal de OpenAI, que ofrece un contexto de 128K con soporte para entrada de texto, imagen y audio. cached_input cachea automáticamente los prefijos a mitad de precio. Como la actualización multimodal de GPT-4 Turbo, ofrece mejor relación calidad-velocidad que su predecesor.
128K contexto; caché automático de entrada (50% de la entrada); Function Calling; Structured Output; comprensión visual; modo JSON; entrada de audio; Batch API a mitad de precio.
Conversación multimodal; comprensión de imágenes; generación de código; extracción de datos estructurados; soporte al cliente empresarial; preguntas y respuestas en la base de conocimientos; interacción por voz.
No genera imágenes (usa DALL·E); sin soporte nativo para cache_write; la alta concurrencia requiere un aumento de cuota; max_tokens limitado a 16K.
Agente de codificación CLI oficial de Anthropic. Ediciones multiarchivo, uso de herramientas y razonamiento de contexto largo.
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_BASE_URL="https://api.robovai.com"
export ANTHROPIC_MODEL="gpt-4o"
claude