Modelos de IA rápidos: baja latencia

A veces la métrica es milisegundos, no el leaderboard. Autocomplete, clasificación en el hot path y UIs que no pueden esperar. Esta colección prioriza variantes flash/lite/mini/highspeed.

9 modelosActualizado 2026-08-27

Modelos en esta colección

ModeloTipoContextoPrecio
Gemini 2.5 Flash-LiteGoogleChat1M tokens$0.109/M in · $0.436/M out
Gemini 3.5 Flash-LiteGoogleChat1M tokens$0.327/M in · $2.7251/M out
Gemini 3.1 Flash-LiteGoogleChat1M tokens$0.2725/M in · $1.6351/M out
DeepSeek V4 FlashDeepSeekChat1M tokens$0.1526/M in · $0.3052/M out
GPT-4.1 mini (legacy)OpenAIChat1M tokens$0.436/M in · $1.7441/M out
Claude Haiku 4.5AnthropicChat200k tokens$1.0901/M in · $5.4503/M out
Ministral 8BMistralChat128k tokens$0.109/M in · $0.109/M out
Kimi K2.7 Code · HighspeedMoonshot (Kimi)Chat262k tokens$1.0356/M in · $8.7205/M out
Gemini 2.5 FlashGoogleChat1M tokens$0.327/M in · $2.7251/M out

Por qué estos modelos

Flash Lite y DeepSeek Flash para el piso de latencia; Haiku y GPT mini cuando quieres velocidad con más juicio; Kimi Highspeed para code chat concurrente.

Úsalos con Geek Hub

Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.

Consigue tu API key

Preguntas frecuentes

¿Rápido = barato?
Casi siempre correlacionan, pero no siempre. Mira precio y p95 de latencia en tu región con un smoke test.
¿Sirven para agentes?
Como workers sí. Como planner único, a veces no. Patrón típico: fast router + strong planner.
¿Streaming ayuda?
Sí a la percepción. Activa stream en el cliente aunque el modelo ya sea rápido.

Más colecciones