← Todos los recursos
·5 min de lectura·Laura Calle

Los modelos de IA, rankeados

Los 12 modelos que sí puedes usar desde Latinoamérica, con su precio real, para qué sirve cada uno y cómo escoger sin volverte loca.

ProductividadPrincipiante
El artículo completo lo acabas de leer gratis. El PDF es para que lo guardes.

Todos los datos de esta guía salen de fuentes públicas y están fechados (agosto de 2026). Los modelos cambian rápido, así que revisa la fecha antes de tomar una decisión de plata.

Qué es un modelo y por qué hay tantos

Un modelo es el motor que está detrás de la aplicación que tú abres. ChatGPT, Claude y Gemini son las aplicaciones. GPT-5.6 Sol, Claude Opus 5 y Gemini 3.7 Flash son los motores.

Una misma empresa saca varios motores al tiempo, unos más potentes y caros y otros más livianos y baratos. No es que uno sea bueno y el otro malo. Es que están hechos para trabajos distintos, igual que no usas un camión para ir por el pan.

La familia, con un ejemplo. OpenAI sacó la familia 5.6 en julio con tres modelos. Sol es el potente y caro. Terra es el del medio. Luna es el liviano y barato. Los tres son el mismo ChatGPT por fuera. Por dentro no.

Por qué cambian cada mes. Solo en agosto de 2026 salieron 39 lanzamientos de IA. Por eso una guía como esta tiene fecha arriba. Lo que no cambia son las preguntas que te ayudan a escoger, y eso es lo que te enseño más abajo.

Lo que más se confunde: el modelo más potente casi nunca es el que tú necesitas. Un modelo mediano hace el trabajo del día a día igual de bien y te puede costar diez veces menos. Esa sola frase te ahorra plata.

Los 12 con precio real

Precio en dólares por millón de tokens de entrada. Más abajo te explico qué es un token. Datos de agosto de 2026.

ModeloPrecioPara qué
GPT-5.6 Sol · S+altoLo más potente que existe. Razonamiento pesado.
Claude Opus 5 · S+altoPuntea en programación. Tareas largas y difíciles.
Claude Fable 5 · S+altoAl mismo nivel. Escritura y razonamiento.
Grok 4.6 · SmedioSubió mucho y quedó 3x más barato que el 4.5.
Claude Sonnet 5 · S$2.00Maneja el computador. 81.2 en OSWorld.
Gemini 3.7 Flash · A$0.75Rapidísimo y con 1M de contexto. El de todos los días.
GPT-5.6 Terra · AmedioEl del medio de la familia 5.6. Uso general.
GPT-5.6 Luna · B$0.20Volumen: correos, resúmenes, clasificar.
DeepSeek V4 Flash · B$0.14El más barato de la lista que igual sirve.
Gemini 3.6 Flash · BbajoLa versión anterior del 3.7. Sigue rindiendo.
Kimi K3 · CabiertoEl abierto más fuerte del top 10. Lo corres tú.
GLM-5.3 · CabiertoSalió en agosto. También lo puedes descargar.
El que yo me saltaría: DeepSeek V4 Pro 0813. Según Artificial Analysis su rendimiento se quedó estancado mientras el precio subió hasta doce veces. Es el único caso de esta lista donde la versión nueva te da menos por más plata. Si venías usando DeepSeek, quédate en el Flash.

Qué es un token

Un token es un pedacito de palabra. Los modelos no leen letras ni palabras completas, leen estos pedacitos. "Inteligencia" puede ser tres o cuatro tokens. Una palabra corta como "casa" suele ser uno.

Importa por una sola razón: te cobran por token. Cada vez que le escribes algo al modelo cuentas tokens de entrada, y cada vez que él te responde cuentas tokens de salida. La salida siempre cuesta más que la entrada.

La regla gruesa para calcular. Un millón de tokens son más o menos 750 mil palabras, o sea unos siete libros. Cuando ves "0.20 dólares por millón de tokens", estás viendo el precio de leer siete libros. Por eso los modelos baratos alcanzan para tanto.

Qué es el contexto. El contexto es cuántos tokens aguanta el modelo de una sola vez, o sea cuánto puede tener en la cabeza al mismo tiempo. Gemini 3.7 Flash aguanta un millón. Eso significa que le puedes pasar un contrato entero, o el historial completo de un cliente, y lo procesa sin partirlo.

Dónde está la trampa: dos modelos pueden cobrar lo mismo por token y aun así costarte distinto, porque uno parte el texto en más pedacitos que el otro. Si vas a mover volumen de verdad, mide con tu propio texto antes de comprometerte.

Cómo escoger en tres preguntas

Esto no se vence cuando salga el modelo del otro mes. Contesta las tres en orden y te queda uno o dos candidatos, no doce.

  1. ¿La tarea es larga o corta?. Corta es una pregunta y una respuesta: redacta este correo, resume esto. Larga es cuando el modelo tiene que encadenar pasos, abrir cosas, revisar y corregirse. Si es corta, no pagues por los de arriba. Si es larga, no ahorres, porque un modelo barato se pierde en el camino y toca repetir.
  2. ¿Cuántas veces al día lo vas a hacer?. Diez veces al día da igual, usa el que te guste. Diez mil veces al día cambia todo: ahí la diferencia entre 0.14 y 2.00 dólares deja de ser un detalle y se vuelve tu factura del mes.
  3. ¿Los datos pueden salir de tu casa?. Si estás moviendo historias clínicas, nóminas o información de clientes, la pregunta ya no es cuál rinde más. Ahí es donde entran los modelos abiertos como Kimi K3, que te descargas y corres en tu propio servidor. Rinden un poco menos y a cambio tus datos no salen a ninguna parte.
El atajo: si no quieres pensar tanto, empieza por la fila A, que es el punto medio. Si te queda corto, subes. Si te sobra, bajas. Casi nadie necesita empezar arriba.

Si haces esto, usa este

Recomendaciones basadas en el precio y en para qué está hecho cada modelo. Si tu caso no está, ubícalo por parecido.

Lo que necesitas hacerCon cuál
Redactar correos y textos del díaGemini 3.7 Flash o GPT-5.6 Luna
Resumir documentos largosGemini 3.7 Flash, por el millón de contexto
Que trabaje solo por horas en algoClaude Sonnet 5 o Claude Opus 5
Programar en serioClaude Opus 5
Razonamiento difícil, análisis pesadoGPT-5.6 Sol
Clasificar o etiquetar miles de cosasDeepSeek V4 Flash
Que maneje el computador por tiClaude Sonnet 5
Datos sensibles que no pueden salirKimi K3 o GLM-5.3, en tu servidor
Probar sin gastar casi nadaDeepSeek V4 Flash
Un consejo de plata: no uses un solo modelo para todo. Lo que hace la gente que sabe es repartir: el barato para el volumen y el caro solo para lo que de verdad lo necesita. Esa mezcla es la que baja la factura sin que se note en el resultado.

Lo que no te dicen los rankings

  • Un ranking es un promedio de varios exámenes metidos en un solo número. Cuando los separas, el primer puesto se mueve. En agosto GPT-5.6 Sol punteaba el promedio, pero en programación iba adelante Claude Opus 5.
  • Las diferencias de arriba son minúsculas. Entre el primero y el tercero había 0.9 puntos. Usándolos no lo sientes.
  • Hay modelos que salen en las listas y no los puedes usar. Claude Mythos puntúa casi igual que los punteros y está cerrado dentro de un programa llamado Project Glasswing.
  • Los exámenes miden razonamiento difícil, matemáticas y código. Tú necesitas que te entienda, que sea rápido y que no te quiebre. No es lo mismo.
  • El precio cambia sin avisar, para arriba y para abajo. El aumento de Claude Sonnet 5 que iba a entrar el 1 de septiembre se canceló.
Si te quedas con una sola idea de toda esta guía, que sea esta: primero define qué vas a hacer, y después miras el ranking. En ese orden el ranking se vuelve fácil. Al revés, te confunde y te cuesta plata.

De dónde salen los datos. Ranking compuesto y puntajes: LLM Stats, corte del 7 de agosto de 2026. Estancamiento y subida de precio de DeepSeek V4 Pro 0813: Artificial Analysis. Cifras de Claude Sonnet 5 (OSWorld 81.2, trabajo de conocimiento 1618): system card de Anthropic, 30 de junio de 2026. Precios y fechas de lanzamiento: páginas oficiales de cada empresa.

Soy Lala. Explico la IA fácil para que nada se te quede atrás. Si quieres esto aplicado en tu empresa —capacitar a tu equipo, automatizar lo repetitivo o montar un WhatsApp que responda solo— escríbeme y te digo con honestidad qué te sirve.

Escríbeme por WhatsApp →