Los mejores modelos de IA de código abierto en 2026: la comparativa con datos
Conclusiones principales
La mayoría de los productos llamados «IA de código abierto» son, con mayor precisión, modelos de pesos abiertos: sus pesos pueden descargarse, pero los datos de entrenamiento, el código o la licencia quizá no cumplan la definición completa de código abierto. En la captura del Open LLM Leaderboard de LLM Stats del 7 de agosto de 2026, Kimi K3 es el líder claro entre los modelos de pesos abiertos, con una puntuación global de 55.4, un índice de razonamiento de 54.5 y un índice de programación de 45.4. GLM-5.2 le sigue con 46.8 global, mientras que DeepSeek V4 Flash destaca como opción de API de bajo coste.
La mejor elección sigue dependiendo del despliegue. Kimi K3 ofrece la mayor capacidad medida, pero tiene 2,8 billones de parámetros totales. GLM-5.2 es más pequeño, aunque continúa siendo un modelo mixture-of-experts de 744 mil millones de parámetros. DeepSeek V4 Flash activa menos parámetros y publica precios de API muy bajos. Que los pesos se puedan descargar no hace que ninguno de estos modelos sea barato de autoalojar.
Respuesta breve: ¿cuál es el mejor modelo de IA de código abierto?
Elige Kimi K3 cuando importe la máxima capacidad de pesos abiertos, GLM-5.2 si quieres un modelo de programación y agentes potente con licencia MIT, y DeepSeek V4 Flash cuando el coste y el rendimiento de la API alojada sean prioritarios. Para un despliegue local en una estación de trabajo, ninguno de estos modelos de frontera encaja de forma automática; compara por separado modelos cuantizados más pequeños según tus límites reales de memoria y latencia.
Comparativa: los mejores modelos de pesos abiertos
Las puntuaciones siguientes proceden del leaderboard abierto en directo de LLM Stats. El precio combinado utiliza una relación 8:1 entre entrada y salida y las tarifas públicas actuales de API cuando están disponibles. Un guion indica que la captura no incluía un valor comparable fiable.
| Modelo | Proveedor | Global | Razonamiento | Programación | Contexto | Precio combinado de API/1M |
|---|---|---|---|---|---|---|
| Kimi K3 | Moonshot AI | 55.4 | 54.5 | 45.4 | 1.0M | $4.33 |
| GLM-5.2 | Z.ai | 46.8 | 46.1 | 38.4 | 1.0M | $1.18* |
| Kimi K2.6 | Moonshot AI | 44.6 | 44.8 | 35.2 | 262K | $1.06* |
| DeepSeek-V4-Pro-Max | DeepSeek | 43.7 | 43.9 | 33.7 | 1.0M | $0.48** |
| GLM-5.1 | Z.ai | 40.4 | 40.1 | 33.1 | 200K | $1.73* |
| Qwen3.5-397B-A17B | Qwen | 39.7 | 39.5 | 23.1 | — | — |
| DeepSeek-V4-Flash-Max | DeepSeek | 39.4 | 40.2 | 29.4 | 1.0M | $0.16** |
* Precio del proveedor recogido en la captura de LLM Stats.
** Calculado a partir de los precios oficiales actuales de API de DeepSeek para deepseek-v4-pro y deepseek-v4-flash; LLM Stats usa etiquetas «Max» para las entradas correspondientes que sigue.
Vista de datos: puntuación global de los modelos abiertos
La ventaja de Kimi K3 es amplia en esta captura. Las puntuaciones son dinámicas y pueden cambiar cuando se actualizan las entradas de los benchmarks o las mediciones en directo, así que trata el gráfico como una lista corta con fecha, no como un veredicto permanente.
Vista de datos: razonamiento y programación
Los dos índices premian comportamientos diferentes. Razonamiento refleja señales de resolución de problemas difíciles; programación combina benchmarks de ingeniería de software y datos de arena. Kimi K3 lidera ambos en la tabla actual de modelos abiertos, mientras que GLM-5.2 es el rival seguido más cercano.
¿Qué ha cambiado desde junio de 2026?
La versión anterior de este artículo señalaba a Kimi K2.6, GLM-5.1 y DeepSeek V4 Pro como líderes. Dos lanzamientos cambiaron ese orden:
- Moonshot AI publicó Kimi K3, un modelo mixture-of-experts multimodal nativo con 2,8 billones de parámetros totales, 104 mil millones de parámetros activados y una ventana de contexto de 1.048.576 tokens.
- Z.ai publicó la tarjeta oficial de GLM-5.2 con licencia MIT, 744 mil millones de parámetros totales, 40 mil millones activados y un millón de tokens de contexto.
- DeepSeek actualizó el endpoint Flash actual a DeepSeek-V4-Flash-0731 y retiró los antiguos alias
deepseek-chatydeepseek-reasonerdespués del 24 de julio.
Las tarjetas de los proveedores son útiles para consultar arquitectura, licencia y detalles de despliegue. Las puntuaciones entre modelos de este artículo proceden de LLM Stats, no de comparar los benchmarks preferidos por cada proveedor.
La mejor IA de pesos abiertos según el caso de uso
Mejor modelo generalista de pesos abiertos: Kimi K3
Kimi K3 es el primer modelo que debes revisar si buscas la mayor capacidad actual con pesos abiertos. Lidera el leaderboard abierto, admite texto e imágenes y soporta un millón de tokens. Moonshot lo posiciona para programación de largo recorrido y trabajo de conocimiento.
La contrapartida es su escala. Sus 2,8 billones de parámetros totales y la licencia Kimi K3 propia exigen que el despliegue incluya tanto un plan de infraestructura como una revisión legal. «Pesos abiertos» no implica que sea apto para un portátil ni que carezca de restricciones.
Mejor modelo abierto para programación y agentes: GLM-5.2
GLM-5.2 es la alternativa seguida más potente después de Kimi K3 y el segundo modelo con mayor puntuación de programación de la tabla. Z.ai publica pesos BF16 y FP8 con licencia MIT, además de instrucciones de despliegue. Su contexto de un millón de tokens está diseñado para tareas prolongadas, pero un modelo 744B-A40B sigue necesitando mucho hardware.
API alojada de menor coste: DeepSeek V4 Flash
DeepSeek V4 Flash es la elección práctica por coste. La API oficial indica actualmente $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida, además de precios mucho menores cuando hay acierto de caché. Admite modos con y sin razonamiento, llamadas a herramientas y un millón de tokens de contexto.
DeepSeek también afirma que está prevista una subida de precios. Consulta la página de precios en directo antes de proyectar el coste de producción, en lugar de considerar permanente la tarifa actual.
Mejor opción para el máximo contexto abierto
Kimi K3, GLM-5.2, DeepSeek V4 Pro y DeepSeek V4 Flash anuncian alrededor de un millón de tokens de entrada. No hay un único ganador en contexto. Decide según la calidad de recuperación, el límite de salida utilizable, la latencia y la fidelidad con la que el modelo cita material situado muy dentro del prompt.
Mejor opción para una estación de trabajo o un servidor pequeño
Este leaderboard de frontera es la herramienta equivocada para esa decisión. Los líderes son enormes mixtures of experts. Para uso local, define primero la RAM o VRAM disponible y compara después variantes cuantizadas más pequeñas en la tarea exacta. Un modelo con menor puntuación que cabe en memoria y responde de forma fiable puede ser el mejor sistema.
Código abierto frente a pesos abiertos
«Pesos abiertos» significa que los parámetros del modelo pueden descargarse. El verdadero código abierto suele exigir una transparencia más amplia y una licencia abierta para el software necesario para estudiar, modificar y redistribuir el sistema. Los datos de entrenamiento y el proceso completo de entrenamiento no suelen estar incluidos.
La diferencia importa en el ámbito comercial:
- los pesos de GLM-5.2 se publican bajo licencia MIT;
- Kimi K3 utiliza la licencia Kimi K3 propia, con condiciones para algunos servicios y productos comerciales de gran escala;
- DeepSeek publica pesos y sus propios términos de modelo;
- cada modelo Qwen puede tener una licencia diferente.
Revisa siempre la licencia asociada al checkpoint exacto, no solo la página de marketing de la familia.
Cómo comparar modelos abiertos de forma justa
Las puntuaciones públicas sirven para formar una lista corta, no para tomar una decisión de compra. Prueba cada candidato con tu idioma, conjunto de herramientas, restricciones de seguridad y forma de despliegue. Mide:
- precisión en la tarea y tasa de fallos;
- latencia y rendimiento con la concurrencia esperada;
- memoria de GPU, energía y coste de operaciones;
- fidelidad al contexto en tus documentos reales;
- encaje de licencia y gobernanza de datos.
Compara por separado el coste total de las opciones alojada y autoalojada. Un precio por token bajo incluye la infraestructura del proveedor; el autoalojamiento traslada ese coste a tus GPU, ingeniería, monitorización y planificación de capacidad.
Conclusión
A 7 de agosto de 2026, Kimi K3 es el modelo generalista de pesos abiertos líder, GLM-5.2 es el segundo clasificado seguido más potente para programación y agentes de largo recorrido, y DeepSeek V4 Flash es la opción de API alojada de bajo coste. Los tres admiten alrededor de un millón de tokens, por lo que el tamaño del contexto ya no decide por sí solo la clasificación. Revisa la licencia exacta y realiza una evaluación consciente del hardware antes del despliegue.
Sigue leyendo: Comparativa de IA 2026 · Mejor IA para programar · Alternativas a ChatGPT
Referencias
- LLM Stats: captura de rendimiento, contexto y precios de proveedores de modelos abiertos. Open LLM Leaderboard
- LLM Stats: metodología de benchmarks y datos en directo. Metodología de LLM Stats
- Moonshot AI: arquitectura, despliegue y licencia de Kimi K3. Tarjeta de Kimi K3
- Z.ai: arquitectura, checkpoints, despliegue y licencia MIT de GLM-5.2. Tarjeta de GLM-5.2
- DeepSeek: lanzamiento de V4 Pro y Flash, pesos abiertos y contexto. Lanzamiento de DeepSeek V4
- DeepSeek: nombres actuales de los modelos, contexto, funciones y precios de API. Modelos y precios de DeepSeek
Artículos Relacionados

La mejor IA para Carta de Presentación y Currículum en 2026
¿Qué IA es la más recomendada para redactar currículums y cartas de presentación en 2026? Comparativa basada en datos de agosto según redacción, filtros ATS y privacidad.

La mejor IA para Matemáticas en 2026: ¿Qué modelo calcula y demuestra mejor?
¿Cuál es la mejor IA para matemáticas en 2026? Comparativa basada en datos de agosto según razonamiento, puntuaciones de BenchLM, precio y velocidad.

La mejor IA para Presentaciones en 2026: Comparativa de Modelos
¿Qué IA es la más adecuada para crear presentaciones en 2026? Comparativa basada en datos de agosto según calidad de contenido, rapidez e integración.
Usa todos estos modelos en un solo lugar
PUNKU.AI conecta Claude, Gemini, GPT y más modelos en una sola plataforma. Crea agentes de IA para tus tareas, sin acumular suscripciones y sin código.
Empieza gratisPrueba gratis • Cambia de modelo cuando quieras • Cancela en cualquier momento
Preguntas frecuentes
¿Cuál es el mejor modelo de IA de código abierto en 2026?
En la captura de LLM Stats del 7 de agosto, Kimi K3 lidera los modelos de pesos abiertos con una puntuación global de 55.4, un índice de razonamiento de 54.5 y un índice de programación de 45.4. GLM-5.2 es el siguiente generalista seguido, con 46.8 global.
¿Son los modelos de pesos abiertos tan buenos como ChatGPT o Claude?
Kimi K3 se sitúa cerca de los modelos de frontera en el leaderboard compuesto actual, pero ninguna puntuación aislada demuestra equivalencia en todas las tareas. Las herramientas del producto, el comportamiento de seguridad, la latencia, las modalidades y la fiabilidad pueden importar más que la diferencia agregada.
¿Cuál es la diferencia entre código abierto y pesos abiertos?
Pesos abiertos significa que los parámetros entrenados pueden descargarse. Código abierto es un estándar más amplio que también depende de las licencias y del acceso al código y a los materiales necesarios para estudiar y modificar el sistema. Revisa siempre la licencia exacta del modelo.
¿Cuál es el modelo de pesos abiertos más barato?
Para una API alojada, DeepSeek V4 Flash tiene la tarifa oficial actual más baja entre los modelos de frontera comparados: $0.14 por millón de tokens de entrada sin caché y $0.28 por millón de tokens de salida. DeepSeek indica que estos precios pueden subir, así que verifícalos antes del despliegue.
¿Puedo autoalojar estos modelos?
Sí, sus pesos están disponibles, pero los líderes son muy grandes. Kimi K3 tiene 2,8 billones de parámetros totales y GLM-5.2, 744 mil millones. El autoalojamiento requiere software de inferencia compatible, varios aceleradores con mucha memoria y presupuesto de operaciones; modelos cuantizados más pequeños pueden ser más prácticos.