Modelos multimodales × mejora de Harness, desbloquea nuevas experiencias de Agent
OpenAI · Texto
GPT-5.6 Terra, un modelo de nivel medio en la serie 5.6, con una ventana de contexto de 272K y una salida de 128K. Rendimiento equilibrado para tareas de producción generales.
OpenAI · Texto
GPT-5.6 Sol, el modelo insignia de OpenAI en la serie 5.6, con una ventana de contexto de 272K y una salida de 128K. Razonamiento de primer nivel, comprensión multimodal y capacidades de programación.
OpenAI · Texto
GPT-5.6 Luna, un modelo rápido y de bajo costo en la serie 5.6, con una ventana de contexto de 272K y una salida de 128K. Ideal para escenarios de alta concurrencia y sensibles al costo.
OpenAI · Texto
OpenAI GPT-5.5 Pro, la capa pro de alto cómputo de GPT-5.5 para el razonamiento de frontera más exigente.
OpenAI · Texto
El último modelo insignia de OpenAI, GPT-5.5, con una ventana de contexto de 272K y una salida de 128K. Destacando en comprensión multimodal, razonamiento y programación.
OpenAI · Texto
OpenAI GPT-5.4 Mini, una variante compacta de GPT-5.4 que equilibra el coste y la capacidad para tareas cotidianas.
OpenAI · Texto
GPT-5.4, con una ventana de contexto de 272K y una salida de 128K. El predecesor de GPT-5.5, que ofrece un rendimiento equilibrado para tareas de producción generales.
OpenAI · Texto
OpenAI GPT-5.4 Pro, el nivel pro de alto rendimiento de cómputo de GPT-5.4 para cargas de trabajo de razonamiento intensas.
OpenAI · Texto
OpenAI GPT-5.4 Nano, la variante más pequeña de GPT-5.4 para tareas ligeras de bajo costo y alto volumen.
OpenAI · Texto
GPT-5.3 Instant, con una ventana de contexto de 272K y salida de 128K. Una versión ultra rápida que equilibra calidad y velocidad, ideal para escenarios sensibles al coste.
Zhipu · Texto
Zhipu's latest flagship GLM-5.3, with major advances in complex software engineering and agent tasks. Same base model as GLM-5.2, all gains from post-training: 50% coding improvement and emergent cybersecurity / vulnerability-discovery capability. 1M context, 128K output, always-on thinking (reasoning_effort: low/high/max).
OpenAI · Texto
GPT-5.3 Codex, optimizado específicamente para tareas de programación, con destacada generación de código de contexto largo y edición coordinada de múltiples archivos.
OpenAI · Texto
GPT-5.2, con una ventana de contexto de 272K y una salida de 128K. Un modelo insignia de generación anterior, una opción versátil para preguntas y respuestas cotidianas, creación de contenido y programación ligera.
Zhipu · Texto
La última bandera de Zhipu, GLM-5.2, con una ventana de contexto de 1M y una salida de 128K. Sobresale en tareas de largo horizonte y se clasifica consistentemente en la parte superior de múltiples benchmarks autoritativos. Utilice el nombre del modelo glm-latest para acceder a la versión más reciente.
OpenAI · Texto
OpenAI GPT-5.2 Pro, la capa pro de alto cálculo de GPT-5.2 para razonamiento avanzado e investigación.
OpenAI · Texto
OpenAI GPT-5.2 Codex, una variante optimizada para programación de GPT-5.2 con fuerte generación de código multiarchivo.
OpenAI · Texto
OpenAI GPT-5.1, 272K contexto + 128K salida. Un modelo de propósito general de generación anterior para tareas de producción cotidianas.
Zhipu · Texto
GLM-5.1, con una ventana de contexto de 200K y una salida de 128K. Predecesor de GLM-5.2, con capacidades de razonamiento y codificación bien equilibradas.
Anthropic · Texto
Claude Opus 5, el último modelo insignia de Anthropic con ventana de contexto de 1M y salida de 128K. Capacidades de razonamiento profundo, codificación y agentes de próxima generación. El pensamiento está activado por defecto y se puede desactivar.
Anthropic · Texto
Claude Sonnet 5, con una ventana de contexto de 1M y salida de 128K. El mejor equilibrio para programación y tareas de agentes cotidianas. El pensamiento está activado por defecto y se puede desactivar.
OpenAI · Texto
OpenAI GPT-5 Codex, optimizado para la programación con generación de código multilingüe destacada y agentic coding.
Anthropic · Texto
Claude Fable 5, con una ventana de contexto de 1M y salida de 128K. Una opción de nivel medio que equilibra capacidad y coste, con el pensamiento activado por defecto.
Zhipu · Texto
GLM-5 Code de Zhipu, optimizado específicamente para tareas de programación, con destacadas capacidades de generación y depuración de código multilingüe.
Doubao · Imagen
ByteDance Doubao Seedream 5.0 Pro, modelo de texto a imagen y edición de imagen de alta calidad, fuerte comprensión de escenas chinas.
OpenAI · Texto
OpenAI GPT-5 Pro, la capa pro de alto cálculo de GPT-5 para las tareas de razonamiento e investigación más exigentes.
Doubao · Imagen
Volcano Engine image generation model
OpenAI · Texto
OpenAI GPT-5 Nano, 272K contexto. El modelo más pequeño y de menor costo para clasificación ligera y enrutamiento.
OpenAI · Texto
OpenAI GPT-5 Mini, 272K contexto. Un modelo compacto y asequible para tareas cotidianas de alto volumen.
OpenAI · Texto
OpenAI GPT-5, 272K contexto + 128K salida. Una bandera anterior con fuerte multimodal, razonamiento y codificación.
Anthropic · Texto
La Opus 4.8 de Anthropic, con ventana de contexto de 1M y salida de 128K. La mejor opción para tareas de razonamiento profundo y agentes de horizonte largo. El pensamiento está activado por defecto y se puede desactivar.
Zhipu · Texto
Zhipu GLM-4.7 Flash, con ventana de contexto de 200K y salida de 128K. Respuestas ultra rápidas a bajo costo, ideales para escenarios de alta concurrencia.
Anthropic · Texto
Anthropic Claude Opus 4.7, 200K contexto, razonamiento profundo y programación para tareas de agentes complejas. Pensamiento activable.
Zhipu · Texto
Zhipu GLM-4.7, con una ventana de contexto de 200K y una salida de 128K. Un modelo de propósito general de grado de producción que equilibra capacidad y coste.
Anthropic · Texto
Anthropic most capable model for coding and complex reasoning
Anthropic · Texto
Most powerful model for highly complex tasks
Anthropic · Texto
Anthropic Claude Opus 4.5, 200K contexto, un anterior modelo insignia para tareas altamente complejas.
Anthropic · Texto
Claude Haiku 4.5, 200K de contexto, velocidad extrema y eficiencia de costos, ideal para tareas ligeras de alta concurrencia.
Anthropic · Texto
Anthropic Claude Sonnet 4.5, 200K contexto, equilibrado en codificación y razonamiento cotidiano, un modelo de generación anterior.
Grok · Texto
xAI Grok 4.5, 256K contexto. El último Grok insignia con razonamiento de vanguardia, programación y acceso a datos en tiempo real.
Doubao · Imagen
ByteDance Doubao Seedream 4.5, un modelo anterior de generación de texto a imagen y edición de imagen, con facturación por imagen.
Grok · Texto
La última bandera de aterrizaje de xAI, Grok 4.3, con una ventana de contexto de 1M y salida de 1M. Integra datos en tiempo real de la plataforma X, con capacidades destacadas de razonamiento y codificación.
Grok · Texto
Grok 4.20 edición de razonamiento multi-agente, con una ventana de contexto ultra larga de 2M y 2M de salida. La mejor opción para razonamiento de múltiples pasos y agentes de horizonte largo. El pensamiento está activado por defecto.
Grok · Texto
xAI Grok 4.1, 256K contexto. Un modelo de propósito general con razonamiento sólido, programación y comprensión multimodal.
OpenAI · Texto
OpenAI GPT-4.1 Nano, la variante más pequeña de GPT-4.1 para tareas ligeras de bajo costo y alto volumen.
Grok · Texto
Grok 4.1 Fast, con una ventana de contexto de 2M. Respuestas ultra rápidas a bajo costo, ideales para tareas de producción de alta concurrencia.
OpenAI · Texto
OpenAI GPT-4.1, 1M contexto + 32K salida. Un modelo de generación anterior fuerte en programación y seguimiento de instrucciones.
OpenAI · Texto
OpenAI GPT-4.1 Mini, una variante compacta de GPT-4.1 que equilibra velocidad y coste para tareas cotidianas.
DeepSeek · Texto
Modelo insignia DeepSeek-V4-Pro, con ventana de contexto de 1M y salida de 384K. Capacidades de agente mejoradas significativamente y rico conocimiento del mundo. El pensamiento está activado por defecto y se puede desactivar.
Grok · Texto
Grok Code Fast, una versión rápida optimizada específicamente para tareas de programación, con una velocidad destacada en la generación y finalización de código.
Grok · Texto
xAI Grok 4 Fast, una variante más rápida y de menor costo de Grok 4 para tareas de producción de alta concurrencia.
DeepSeek · Texto
DeepSeek-V4-Flash, con una ventana de contexto de 1M y 384K de salida. Proporciona un servicio de API más rápido y más económico. El pensamiento está activado por defecto y se puede desactivar.
Grok · Texto
Grok 4, con una ventana de contexto de 256K. Ofrece razonamiento profundo y comprensión multimodal, muy adecuado para tareas de agentes complejas.
OpenAI · Texto
Affordable and intelligent small model
OpenAI · Visión
OpenAI multimodal flagship model with vision support
Qwen · Texto
La última bandera de Tongyi, Qwen3.8, con una ventana de contexto de 992K y una salida de 64K. Líder en capacidades de razonamiento y multilingüe, muy adecuado para tareas complejas.
Qwen · Multimodal
Alibaba Qwen3.7 Plus, modelo de agente multimodal rentable con capacidades de visión-idioma mejoradas. Soporta operación GUI y generación de código con referencia visual. 1M contexto + 64K salida. Pensamiento activado por defecto.
Qwen · Multimodal
Qwen3.7 Flash, un modelo Flash nativo de visión-idioma con contexto de 1M y salida de 64K. Comprensión multimodal y ejecución de agentes mejoradas sobre 3.6 Flash.
Qwen · Texto
Alibaba Qwen3.7 Max, modelo insignia de próxima generación para la era de los agentes. Sobresale en programación, productividad de oficina y ejecución autónoma a largo plazo. 1M de contexto + 64K de salida. Pensamiento activado por defecto.
Qwen · Texto
Alibaba Qwen3.6 Max Preview, el modelo más capaz de la serie Qwen3.6. Destaca por sus capacidades de codificación y agentes de codificación. 256K contexto + 64K salida. ⚠️ Retirado el 10 de octubre.
Gemini · Texto
Gemini 3.6 Flash, el último modelo Flash de Google con ventana de contexto de 1M y salida de 64K. Equilibra velocidad y calidad, ideal para tareas de producción generales.
Qwen · Multimodal
Alibaba Qwen3.6 Plus, modelo nativo vision-language Plus. Actualizado agentic coding, programación frontend, reconocimiento multimodal y OCR. 1M contexto + 64K salida. Soporta thinking.
Qwen · Multimodal
Alibaba Qwen3.6 Flash, modelo nativo visión-lingüística Flash. Mejorado codificación con agentes, razonamiento matemático e inteligencia espacial. 1M de contexto + 64K de salida. Rápido y rentable.
Qwen · Texto
Qwen3.5 Flash, 992K contexto + 64K salida. Un modelo ultra rápido y de bajo costo para tareas de producción de alta concurrencia.
Gemini · Texto
Gemini 3.5 Flash, con una ventana de contexto de 1M y 64K de salida. Equilibra velocidad y calidad, muy adecuado para tareas de producción generales.
Gemini · Texto
Google Gemini 3.5 Flash Lite, 1M contexto. Extremadamente ligero y de bajo costo, ideal para escenarios de alta concurrencia.
Qwen · Texto
Qwen3.5 Plus, con ventana de contexto de 992K y salida de 64K. Un modelo de propósito general de grado de producción que equilibra capacidad y coste.
DeepSeek · Texto
DeepSeek V3.2, 128K de contexto, razonamiento y eficiencia de salida equilibrados, adecuado para tareas diarias y de producción.
DeepSeek · Texto
DeepSeek V3.1, 128K contexto. Un modelo equilibrado con razonamiento sólido y eficiencia de salida para tareas diarias y de producción.
Gemini · Video
Google Veo 3.1, generación de alta calidad texto a video y video a video con audio, ideal para clips cinematográficos.
Gemini · Imagen
Modelo de generación de imágenes Gemini 3.1 Flash, con potentes capacidades de generación de texto a imagen y edición de imágenes. Ideal para activos de marketing y asistencia de diseño.
Gemini · Texto
Gemini 3.1 Pro Preview, con una ventana de contexto de 1M y una salida de 64K. El modelo insignia de Google DeepMind, líder en comprensión multimodal y razonamiento de contexto largo.
Gemini · Texto
Gemini 3.1 Flash Lite, con una ventana de contexto de 1M y salida de 64K. Extremadamente ligero y de bajo costo, ideal para escenarios de alta concurrencia.
Grok · Texto
xAI Grok 3, 128K contexto. Un modelo insignia de generación anterior con fuerte razonamiento y datos de la plataforma X en tiempo real.
Qwen · Texto
Qwen3 235B, contexto de 256K. El modelo insignia open-weight MoE con fuerte razonamiento general y capacidad multilingüe.
Qwen · Texto
Qwen3 Coder 480B, contexto de 256K. El modelo de código de pesos abiertos de gama alta con fuerte generación multilingüe y comprensión de código de contexto largo.
DeepSeek · Texto
DeepSeek OCR, un modelo de comprensión de documentos que extrae texto y estructura de imágenes y documentos escaneados.
Moonshot · Texto
Kimi K3, el último modelo insignia de Moonshot AI con una ventana de contexto de 1M tokens y una salida de 128K. Razonamiento de vanguardia, procesamiento de contexto largo y capacidades de codificación. Thinking está activado por defecto y se puede desactivar.
Qwen · Visión
Qwen3 VL 235B, contexto de 128K. El modelo multimodal de pesos abiertos con fuerte comprensión de imágenes, documentos y OCR.
MiniMax · Texto
MiniMax M3, un modelo de lenguaje de próxima generación y bandera con una ventana de contexto de 1M y una salida de 128K. Logra resultados líderes en la industria en pruebas de programación y agentes, y es muy adecuado para el razonamiento de agentes y Function Calling.
Qwen · Texto
Qwen3 Coder Plus, con una ventana de contexto de 998K y salida de 64K. Optimizado específicamente para tareas de programación, con destacada generación de código multilingüe y comprensión de código de contexto largo.
Qwen · Visión
Modelo de comprensión visual Qwen3 VL Plus, con una ventana de contexto de 260K. Admite comprensión de imágenes y documentos, así como razonamiento multimodal.
Gemini · Texto
Google Gemini 3 Flash, 1M contexto + 64K de salida. Un modelo rápido de generación anterior para tareas de producción generales.
Qwen · Texto
Qwen3 Coder Flash, con ventana de contexto de 998K y salida de 64K. Un modelo de codificación ultrarrápido ideal para la finalización y generación de código de alta concurrencia.
DeepSeek · Texto
Cost-effective model with strong coding ability
Gemini · Imagen
Gemini 3 Pro, el modelo insignia de generación de imágenes, ofrece text-to-image de alta calidad y análisis complejo de instrucciones. Ideal para la creación visual profesional.
Grok · Texto
xAI Grok 3 Fast, una variante más rápida y de menor costo de Grok 3 para tareas de producción de alta concurrencia.
MiniMax · Texto
MiniMax M2.7, 1M contexto. Un modelo de propósito general de generación anterior que equilibra capacidad y coste para producción.
Moonshot · Multimodal
Modelo insignia de próxima generación de Moonshot AI, Kimi K2.7, multimodal y multilingüe con contexto de 256K. Sobresalientes capacidades de contexto largo y de programación. El pensamiento está activado por defecto y se puede desactivar.
Moonshot · Texto
El modelo de próxima generación de Moonshot AI, Kimi K2.6, con una ventana de contexto de 262K. Capacidades sobresalientes de long-context y programación. Thinking está activado por defecto y se puede desactivar.
MiniMax · Texto
MiniMax M2.5, con una ventana de contexto de 1M. Un modelo de propósito general de grado de producción que equilibra capacidad y coste.
Moonshot · Texto
Kimi K2.5, con una ventana de contexto de 262K. Equilibra la capacidad de razonamiento con la velocidad de salida, muy adecuado para tareas de agentes generales. El pensamiento está activado por defecto y se puede desactivar.
Gemini · Embedding
Gemini Embedding 2, con entrada de 8K. Convierte texto en vectores de alta dimensión para escenarios de búsqueda semántica y RAG.
google · Texto
Fast and versatile model with long context
google · Visión
Google most capable model with 1M context window
Gemini · Texto
Google Gemini 2.5 Flash Lite, 1M contexto. La variante Flash de menor costo para tareas ligeras de alto volumen.
OpenAI · Video
OpenAI 视频生成专业版。
OpenAI · Video
OpenAI 视频生成,文生/图生视频。
wan · Video
单图+音频驱动,生成说话/唱歌/表演数字人视频。
wan · Video
通过指令对视频进行编辑,支持局部/整体编辑、视频重塑、视频复刻等
wan · Video
参考视频中的人或物,精准保持形象和声音,支持多参考合拍
wan · Video
图片生成视频内容,稳定保持图像主体、风格和文字等细节信息
wan · Video
文字生成视频内容,丝滑动态能力,电影美学控制,精准指令遵循
MiniMax · Texto
MiniMax M2.1, 1M context. Un modelo generalista legado para tareas de producción de alto volumen sensibles al coste.
Doubao · Texto
ByteDance Doubao Seed 2.1 Turbo, equilibrio entre velocidad y calidad, contexto de 256K, rentable para tareas de producción.
Doubao · Texto
ByteDance Doubao Seed Evolving, modelo de rápida iteración, 256K context, actualizado continuamente con las últimas capacidades.
Doubao · Texto
ByteDance Doubao Seed 2.1 Pro, flagship con capacidades mejoradas, contexto de 256K, fuertes capacidades de razonamiento y agente.
wan · Video
多模态全能参考,灵活可控生成视频内容,轻松实现故事创作、创意表达、营销物料制作等
happyhorse · Video
HappyHorse-Video-Edit支持视频编辑,自然语言指令编辑视频,可参考最多5张图片局部或全局编辑视频元素,能够精准复刻视频动态过程,实现更强表现能力。
Qwen · TTS
Síntesis de voz Qwen Audio 3.0 Plus, voces naturales de alta calidad.
Doubao · Texto
ByteDance Doubao Seed Character, un modelo orientado al roleplay con fuerte coherencia de personalidad e interacción con personajes, contexto de 256K.
Doubao · Video
El modelo de generación de video ByteDance Doubao Seedance 2.0 Mini, que admite la generación y edición de video, es ideal para videos cortos y motion graphics.
Doubao · Video
ByteDance Doubao Seedance 2.0 Fast, una variante más rápida de Seedance 2.0 para la generación de video rápida a menor costo.
happyhorse · Video
Alibaba HappyHorse 1.1 R2V, generación de video a partir de referencia que admite hasta 9 imágenes de referencia, con una mayor consistencia de sujeto/escena/estilo. Facturación por segundo.
Doubao · Texto
Doubao Seed 2.0 Lite equilibra la calidad de generación con la velocidad de respuesta, siendo adecuado para trabajos de producción como el procesamiento de información no estructurada, la creación de contenido y el análisis de datos. El pensamiento está activado por defecto y se puede desactivar.
Doubao · Texto
Doubao Seed 2.0 Mini está diseñado para escenarios de baja latencia, alta concurrencia y sensibles al costo con inferencia ultrarrápida. El pensamiento está activado por defecto y se puede desactivar.
Doubao · 3D
ByteDance Doubao modelo de generación 3D Seed3D 2.0, imagen a 3D, ideal para activos 3D y modelado de escenas de juegos.
Doubao · Video
ByteDance Doubao Seedance 2.0, generación de texto a video y video a video de alta calidad, ideal para videos cinematográficos cortos.
Qwen · Imagen
Modelo de generación de imágenes Tongyi Qwen 3.0 Pro, compatible con texto a imagen y edición de imagen en resolución 1K/2K, con facturación separada de entrada y salida. Ideal para activos de marketing de alta calidad y creación de diseños.
Qwen · Imagen
Modelo de generación de imágenes Tongyi Qwen 3.0, compatible con texto a imagen y edición de imagen en resolución 1K/2K. Una opción rentable.
Doubao · Video
新一代视频创作模型,单次 30 秒长叙事、全模态参考、视频编辑与延长。
Doubao · 3D
Hyper3D Gen2 por Yingmou (影眸科技), generación de imagen a 3D alojada en Volcengine Ark. Ideal para activos 3D y modelado de escenas de juego.
fun · music
Generación de música Tongyi, facturada por segundos de audio generados.
Qwen · ASR
Reconocimiento de voz Qwen Flash para transcripción de archivos de audio.
Qwen · ASR
Reconocimiento de voz Qwen Audio 3.0 Flash para transcripción de archivos de audio.
fun · TTS
Síntesis de voz CosyVoice 3.5 Plus, voces multilingües de alta calidad.
fun · TTS
Síntesis de voz CosyVoice 3.5 Flash, rentable.
Qwen · Embedding
Modelo de embeddings de texto Qwen más reciente, ideal para recuperación y coincidencia semántica.
Qwen · Texto
Modelo insignia de código abierto Tongyi Qwen 3.8, MoE de 2.4T parámetros (95B activos), con modos de razonamiento y no razonamiento.
wan · Video
Wan intercambio de rostro en vídeo: reemplaza al personaje de un vídeo, modos estándar/pro.
Qwen · Texto
Modelo denso de código abierto Tongyi Qwen 3.8 de 27B, una opción equilibrada y rentable.
Qwen · Texto
Modelo de contexto largo Qwen, diseñado para escenarios de contexto ultralargo.
Qwen · Texto
Modelo de investigación profunda Qwen, con búsqueda de varios pasos, análisis y generación de informes automáticos.
Qwen · TTS
Síntesis de voz Qwen Audio 3.0 Flash, baja latencia y rentable.
Qwen · Visión
Modelo de visión Qwen OCR para reconocimiento de documentos y extracción de información estructurada.
kling · Imagen
Generación de imágenes Kling V3 con resoluciones 1K/2K/4K.
kling · Video
Generación de vídeo Kling V3, compatible con silencio/audio y resoluciones 720P/1080P/4K.
wan · Video
Wan imagen a movimiento: genera vídeo de retrato con un movimiento de referencia, modos estándar/pro.
Doubao · 3D
Hitem3D 2.0 por Shumei (数美万物), generación de imagen a 3D alojada en Volcengine Ark. Ideal para activos 3D y modelado de escenas.
Doubao · Texto
ByteDance Doubao Seed Code, un modelo optimizado para programación con fuerte generación y depuración multilingüe, contexto de 256K.
Qwen · Imagen
Modelo de generación de imágenes Tongyi Wanxiang Qwen Image 2.0 Pro, que ofrece generación de texto a imagen y edición de imagen de alta calidad. Ideal para activos de marketing y creación de diseños.
happyhorse · Video
Modelo de generación de video T2V Alibaba Cloud HappyHorse 1.1. Texto a video con dinámica, textura y audio mejoradas. Movimiento de personajes y atmósfera de escena más fluidos y naturales.
happyhorse · Video
Alibaba HappyHorse 1.1 I2V, generación de imagen a video con texturas mejoradas, movimiento y coherencia cross-clip. Facturación por segundo.
Doubao · Texto
ByteDance Doubao Seed Translation, un modelo de traducción especializado en traducción multilingüe de alta calidad, contexto de 256K.
Doubao · Texto
Doubao Seed 2.0 Pro, un modelo generalista todo terreno de gama alta con comprensión multimodal mejorada, razonamiento de contexto largo, generación estructurada y ejecución de herramientas. El pensamiento está activado por defecto y se puede desactivar.
Doubao · Texto
Doubao Seed 2.0 Code se basa en las capacidades de agente y VLM de Seed 2.0 para fortalecer la programación, con un trabajo destacado en front-end y soporte multilingüe. Sin pensar por defecto, con pensamiento profundo disponible a petición.
Doubao · Texto
ByteDance Doubao Seed 1.8, modelo ligero y económico, contexto de 256K, adecuado para escenarios de alta concurrencia.
Doubao · Visión
ByteDance Doubao Seed 1.6 Vision, un modelo de visión multimodal de generación anterior, contexto de 256K, comprensión de imágenes y documentos.
Doubao · Texto
ByteDance Doubao Seed 1.6 Flash, una variante ultrarrápida y ligera de 1.6, contexto de 256K, ideal para escenarios de alta concurrencia.
Doubao · Texto
ByteDance Doubao Seed 1.6, un modelo de propósito general de generación anterior, contexto de 256K, rentable para tareas cotidianas.
Doubao · Visión
ByteDance Doubao 1.5 Vision Lite, un modelo de visión multimodal ligero heredado, contexto de 256K, comprensión de imágenes rentable.
Doubao · Video
ByteDance Doubao Seedance 1.5 Pro, un modelo de generación de video de generación anterior que admite salida de video con audio y video silencioso.
Qwen · TTS
通义千问语音合成 Instruct Flash 版。
Qwen · TTS
通义千问语音合成 Flash 版。
Doubao · Embedding
El modelo de incrustación de gran escala de Doubao convierte texto en representaciones vectoriales de alta dimensión para escenarios de búsqueda semántica y RAG.
Qwen · Embedding
Qwen3 Reranker 8B, un reranker de pesos abiertos que reordena los documentos recuperados por relevancia para una recuperación de información (RAG) de mayor calidad.
Doubao · Embedding
ByteDance Doubao Embedding Vision, modelo de incrustación multimodal que admite entrada de imagen y texto.
Qwen · Texto
Qwen Turbo, con una ventana de contexto de 1M y salida de 16K. Extremadamente ligero y de bajo costo, ideal para tareas simples de alta concurrencia.
Qwen · Embedding
Qwen3 Embedding 8B, un modelo de incrustación de texto de pesos abiertos que produce vectores de alta calidad para búsqueda semántica y RAG.
Doubao · TTS
High-quality text-to-speech model.
Doubao · Embedding
ByteDance Doubao Embedding, modelo de incrustación de texto estándar, representación vectorial de alta calidad para búsqueda semántica y RAG.
Doubao · ASR
豆包流式语音识别模型 2.0,火山引擎语音团队基于大模型语音识别能力全新升级,依托业界领先的自研语音识别技术和海量的语音行业大数据优势,语音识别大模型拥有更加灵敏的耳朵+更加聪明的大脑。
Auto · Texto
Modelo de enrutamiento inteligente que coincide inteligentemente con combinaciones de computación y modelos en términos de calidad y velocidad. Acceso anticipado a los modelos más recientes de ByteDance y su ecosistema.