Modelos para RAG: responder sobre tu conocimiento
RAG = retrieve + generate. Los embeddings traen chunks; el chat contesta sin alucinar de más. Esta colección es el lado generate: modelos que siguen instrucciones, citan contexto y no queman el presupuesto en cada query.
Modelos en esta colección
| Modelo | Tipo | Contexto | Precio |
|---|---|---|---|
| Chat | 1M tokens | $0.436/M in · $1.7441/M out | |
| Chat | 1M tokens | $0.327/M in · $2.7251/M out | |
| Chat | 200k tokens | $1.0901/M in · $5.4503/M out | |
| Chat | 272k tokens | $0.8175/M in · $4.9053/M out | |
| Chat | 2M tokens | $1.3626/M in · $10.9006/M out | |
| Chat | 1M tokens | $3.2702/M in · $16.3509/M out | |
| Chat | 1M tokens | $0.1526/M in · $0.3052/M out | |
| Chat | 128k tokens | $0.109/M in · $0.327/M out |
Por qué estos modelos
Flash/mini/Haiku para el 90% de preguntas; Pro/Sonnet cuando el retrieval es ruidoso o la respuesta es crítica. Empareja con la colección Embedding Models.
Úsalos con Geek Hub
Una base URL compatible con OpenAI y una API key. Cambia cualquier model id de esta lista sin reescribir tu cliente.
Consigue tu API keyPreguntas frecuentes
- ¿Qué embedding uso con estos?
- text-embedding-3-small por default. Ver Embedding Models. No mezcles dimensiones en el mismo índice.
- ¿Contexto largo en vez de RAG?
- A veces. Si el corpus cabe y el costo de input aguanta, long-context puede bastar. RAG escala mejor a GBs de docs.
- ¿Cómo reduzco alucinaciones?
- Prompt estricto (“solo usa el contexto”), top-k decente, y un modelo que obedezca (Sonnet/GPT mini). Mide con evals de groundedness.