Comparativa de IA

Los mejores modelos de IA de código abierto en 2026: la comparativa con datos

Equipo de Investigación de PUNKU.AI
10 min de lectura

Conclusiones principales

Kimi K3 es el modelo generalista de pesos abiertos más potente en la actualidad. Lidera el leaderboard abierto en los índices global, de razonamiento y de programación, y admite una ventana de contexto de 1.048.576 tokens.
GLM-5.2 es el segundo clasificado de menor coste más potente de la tabla seguida. Alcanza 46.8 global y 38.4 en programación, con un millón de tokens de contexto y pesos con licencia MIT.
DeepSeek V4 Flash lidera en precio de API. DeepSeek indica actualmente $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida, con un millón de tokens de contexto.
Un millón de tokens de contexto ya no es exclusivo. Kimi K3, GLM-5.2 y los dos niveles de DeepSeek V4 anuncian aproximadamente un millón de tokens de entrada.
«Abierto» no significa sin restricciones. Kimi K3 utiliza una licencia propia con condiciones comerciales; otras familias aplican términos diferentes. Revisa el artefacto y la versión exactos.
El hardware cambia la clasificación. Un modelo económico mediante una API alojada puede exigir una costosa infraestructura con varias GPU cuando se autoaloja.

La mayoría de los productos llamados «IA de código abierto» son, con mayor precisión, modelos de pesos abiertos: sus pesos pueden descargarse, pero los datos de entrenamiento, el código o la licencia quizá no cumplan la definición completa de código abierto. En la captura del Open LLM Leaderboard de LLM Stats del 7 de agosto de 2026, Kimi K3 es el líder claro entre los modelos de pesos abiertos, con una puntuación global de 55.4, un índice de razonamiento de 54.5 y un índice de programación de 45.4. GLM-5.2 le sigue con 46.8 global, mientras que DeepSeek V4 Flash destaca como opción de API de bajo coste.

La mejor elección sigue dependiendo del despliegue. Kimi K3 ofrece la mayor capacidad medida, pero tiene 2,8 billones de parámetros totales. GLM-5.2 es más pequeño, aunque continúa siendo un modelo mixture-of-experts de 744 mil millones de parámetros. DeepSeek V4 Flash activa menos parámetros y publica precios de API muy bajos. Que los pesos se puedan descargar no hace que ninguno de estos modelos sea barato de autoalojar.

Respuesta breve: ¿cuál es el mejor modelo de IA de código abierto?

Elige Kimi K3 cuando importe la máxima capacidad de pesos abiertos, GLM-5.2 si quieres un modelo de programación y agentes potente con licencia MIT, y DeepSeek V4 Flash cuando el coste y el rendimiento de la API alojada sean prioritarios. Para un despliegue local en una estación de trabajo, ninguno de estos modelos de frontera encaja de forma automática; compara por separado modelos cuantizados más pequeños según tus límites reales de memoria y latencia.

Comparativa: los mejores modelos de pesos abiertos

Las puntuaciones siguientes proceden del leaderboard abierto en directo de LLM Stats. El precio combinado utiliza una relación 8:1 entre entrada y salida y las tarifas públicas actuales de API cuando están disponibles. Un guion indica que la captura no incluía un valor comparable fiable.

ModeloProveedorGlobalRazonamientoProgramaciónContextoPrecio combinado de API/1M
Kimi K3Moonshot AI55.454.545.41.0M$4.33
GLM-5.2Z.ai46.846.138.41.0M$1.18*
Kimi K2.6Moonshot AI44.644.835.2262K$1.06*
DeepSeek-V4-Pro-MaxDeepSeek43.743.933.71.0M$0.48**
GLM-5.1Z.ai40.440.133.1200K$1.73*
Qwen3.5-397B-A17BQwen39.739.523.1
DeepSeek-V4-Flash-MaxDeepSeek39.440.229.41.0M$0.16**

* Precio del proveedor recogido en la captura de LLM Stats. ** Calculado a partir de los precios oficiales actuales de API de DeepSeek para deepseek-v4-pro y deepseek-v4-flash; LLM Stats usa etiquetas «Max» para las entradas correspondientes que sigue.

Vista de datos: puntuación global de los modelos abiertos

La ventaja de Kimi K3 es amplia en esta captura. Las puntuaciones son dinámicas y pueden cambiar cuando se actualizan las entradas de los benchmarks o las mediciones en directo, así que trata el gráfico como una lista corta con fecha, no como un veredicto permanente.

LLM StatsSnapshot: 7 de agosto de 2026
puntuación global de los principales modelos de pesos abiertos
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.

Vista de datos: razonamiento y programación

Los dos índices premian comportamientos diferentes. Razonamiento refleja señales de resolución de problemas difíciles; programación combina benchmarks de ingeniería de software y datos de arena. Kimi K3 lidera ambos en la tabla actual de modelos abiertos, mientras que GLM-5.2 es el rival seguido más cercano.

LLM StatsSnapshot: 7 de agosto de 2026
índice de razonamiento de modelos de pesos abiertos
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.
LLM StatsSnapshot: 7 de agosto de 2026
índice de programación de modelos de pesos abiertos
Score aus statischem LLM-Stats-Snapshot. Keine Live-API im Browser.

¿Qué ha cambiado desde junio de 2026?

La versión anterior de este artículo señalaba a Kimi K2.6, GLM-5.1 y DeepSeek V4 Pro como líderes. Dos lanzamientos cambiaron ese orden:

  • Moonshot AI publicó Kimi K3, un modelo mixture-of-experts multimodal nativo con 2,8 billones de parámetros totales, 104 mil millones de parámetros activados y una ventana de contexto de 1.048.576 tokens.
  • Z.ai publicó la tarjeta oficial de GLM-5.2 con licencia MIT, 744 mil millones de parámetros totales, 40 mil millones activados y un millón de tokens de contexto.
  • DeepSeek actualizó el endpoint Flash actual a DeepSeek-V4-Flash-0731 y retiró los antiguos alias deepseek-chat y deepseek-reasoner después del 24 de julio.

Las tarjetas de los proveedores son útiles para consultar arquitectura, licencia y detalles de despliegue. Las puntuaciones entre modelos de este artículo proceden de LLM Stats, no de comparar los benchmarks preferidos por cada proveedor.

La mejor IA de pesos abiertos según el caso de uso

Mejor modelo generalista de pesos abiertos: Kimi K3

Kimi K3 es el primer modelo que debes revisar si buscas la mayor capacidad actual con pesos abiertos. Lidera el leaderboard abierto, admite texto e imágenes y soporta un millón de tokens. Moonshot lo posiciona para programación de largo recorrido y trabajo de conocimiento.

La contrapartida es su escala. Sus 2,8 billones de parámetros totales y la licencia Kimi K3 propia exigen que el despliegue incluya tanto un plan de infraestructura como una revisión legal. «Pesos abiertos» no implica que sea apto para un portátil ni que carezca de restricciones.

Mejor modelo abierto para programación y agentes: GLM-5.2

GLM-5.2 es la alternativa seguida más potente después de Kimi K3 y el segundo modelo con mayor puntuación de programación de la tabla. Z.ai publica pesos BF16 y FP8 con licencia MIT, además de instrucciones de despliegue. Su contexto de un millón de tokens está diseñado para tareas prolongadas, pero un modelo 744B-A40B sigue necesitando mucho hardware.

API alojada de menor coste: DeepSeek V4 Flash

DeepSeek V4 Flash es la elección práctica por coste. La API oficial indica actualmente $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida, además de precios mucho menores cuando hay acierto de caché. Admite modos con y sin razonamiento, llamadas a herramientas y un millón de tokens de contexto.

DeepSeek también afirma que está prevista una subida de precios. Consulta la página de precios en directo antes de proyectar el coste de producción, en lugar de considerar permanente la tarifa actual.

Mejor opción para el máximo contexto abierto

Kimi K3, GLM-5.2, DeepSeek V4 Pro y DeepSeek V4 Flash anuncian alrededor de un millón de tokens de entrada. No hay un único ganador en contexto. Decide según la calidad de recuperación, el límite de salida utilizable, la latencia y la fidelidad con la que el modelo cita material situado muy dentro del prompt.

Mejor opción para una estación de trabajo o un servidor pequeño

Este leaderboard de frontera es la herramienta equivocada para esa decisión. Los líderes son enormes mixtures of experts. Para uso local, define primero la RAM o VRAM disponible y compara después variantes cuantizadas más pequeñas en la tarea exacta. Un modelo con menor puntuación que cabe en memoria y responde de forma fiable puede ser el mejor sistema.

Código abierto frente a pesos abiertos

«Pesos abiertos» significa que los parámetros del modelo pueden descargarse. El verdadero código abierto suele exigir una transparencia más amplia y una licencia abierta para el software necesario para estudiar, modificar y redistribuir el sistema. Los datos de entrenamiento y el proceso completo de entrenamiento no suelen estar incluidos.

La diferencia importa en el ámbito comercial:

  • los pesos de GLM-5.2 se publican bajo licencia MIT;
  • Kimi K3 utiliza la licencia Kimi K3 propia, con condiciones para algunos servicios y productos comerciales de gran escala;
  • DeepSeek publica pesos y sus propios términos de modelo;
  • cada modelo Qwen puede tener una licencia diferente.

Revisa siempre la licencia asociada al checkpoint exacto, no solo la página de marketing de la familia.

Cómo comparar modelos abiertos de forma justa

Las puntuaciones públicas sirven para formar una lista corta, no para tomar una decisión de compra. Prueba cada candidato con tu idioma, conjunto de herramientas, restricciones de seguridad y forma de despliegue. Mide:

  1. precisión en la tarea y tasa de fallos;
  2. latencia y rendimiento con la concurrencia esperada;
  3. memoria de GPU, energía y coste de operaciones;
  4. fidelidad al contexto en tus documentos reales;
  5. encaje de licencia y gobernanza de datos.

Compara por separado el coste total de las opciones alojada y autoalojada. Un precio por token bajo incluye la infraestructura del proveedor; el autoalojamiento traslada ese coste a tus GPU, ingeniería, monitorización y planificación de capacidad.

Conclusión

A 7 de agosto de 2026, Kimi K3 es el modelo generalista de pesos abiertos líder, GLM-5.2 es el segundo clasificado seguido más potente para programación y agentes de largo recorrido, y DeepSeek V4 Flash es la opción de API alojada de bajo coste. Los tres admiten alrededor de un millón de tokens, por lo que el tamaño del contexto ya no decide por sí solo la clasificación. Revisa la licencia exacta y realiza una evaluación consciente del hardware antes del despliegue.

Sigue leyendo: Comparativa de IA 2026 · Mejor IA para programar · Alternativas a ChatGPT

Referencias

  1. LLM Stats: captura de rendimiento, contexto y precios de proveedores de modelos abiertos. Open LLM Leaderboard
  2. LLM Stats: metodología de benchmarks y datos en directo. Metodología de LLM Stats
  3. Moonshot AI: arquitectura, despliegue y licencia de Kimi K3. Tarjeta de Kimi K3
  4. Z.ai: arquitectura, checkpoints, despliegue y licencia MIT de GLM-5.2. Tarjeta de GLM-5.2
  5. DeepSeek: lanzamiento de V4 Pro y Flash, pesos abiertos y contexto. Lanzamiento de DeepSeek V4
  6. DeepSeek: nombres actuales de los modelos, contexto, funciones y precios de API. Modelos y precios de DeepSeek

Usa todos estos modelos en un solo lugar

PUNKU.AI conecta Claude, Gemini, GPT y más modelos en una sola plataforma. Crea agentes de IA para tus tareas, sin acumular suscripciones y sin código.

Empieza gratis

Prueba gratis • Cambia de modelo cuando quieras • Cancela en cualquier momento

Preguntas frecuentes

¿Cuál es el mejor modelo de IA de código abierto en 2026?

En la captura de LLM Stats del 7 de agosto, Kimi K3 lidera los modelos de pesos abiertos con una puntuación global de 55.4, un índice de razonamiento de 54.5 y un índice de programación de 45.4. GLM-5.2 es el siguiente generalista seguido, con 46.8 global.

¿Son los modelos de pesos abiertos tan buenos como ChatGPT o Claude?

Kimi K3 se sitúa cerca de los modelos de frontera en el leaderboard compuesto actual, pero ninguna puntuación aislada demuestra equivalencia en todas las tareas. Las herramientas del producto, el comportamiento de seguridad, la latencia, las modalidades y la fiabilidad pueden importar más que la diferencia agregada.

¿Cuál es la diferencia entre código abierto y pesos abiertos?

Pesos abiertos significa que los parámetros entrenados pueden descargarse. Código abierto es un estándar más amplio que también depende de las licencias y del acceso al código y a los materiales necesarios para estudiar y modificar el sistema. Revisa siempre la licencia exacta del modelo.

¿Cuál es el modelo de pesos abiertos más barato?

Para una API alojada, DeepSeek V4 Flash tiene la tarifa oficial actual más baja entre los modelos de frontera comparados: $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida. DeepSeek indica que estos precios pueden subir, así que verifícalos antes del despliegue.

¿Puedo autoalojar estos modelos?

Sí, sus pesos están disponibles, pero los líderes son muy grandes. Kimi K3 tiene 2,8 billones de parámetros totales y GLM-5.2, 744 mil millones. El autoalojamiento requiere software de inferencia compatible, varios aceleradores con mucha memoria y presupuesto de operaciones; modelos cuantizados más pequeños pueden ser más prácticos.