¿Qué es Qwen3.8-27B y se puede ejecutar en un PC de casa?

Alibaba publica Qwen3.8-27B con licencia Apache 2.0, visión y 262.000 tokens de contexto. Qué es, qué hardware necesita y para quién tiene sentido en local.

¿Qué es Qwen3.8-27B y se puede ejecutar en un PC de casa?

Ilustración: Criterio Tech

E
Publicado el 5 de octubre de 2026

Este artículo contiene enlaces de afiliado: si compras a través de ellos podemos recibir una comisión, sin coste para ti. Más información.

En 30 segundos

Qwen3.8-27B es un modelo abierto de 27.000 millones de parámetros que Alibaba publicó en Hugging Face y ModelScope a mediados de agosto de 2026 con licencia Apache 2.0. Entiende texto, imágenes y vídeo, admite 262.144 tokens de contexto y, cuantizado, puede funcionar en una gráfica de consumo con suficiente VRAM.

¿Qué se ha anunciado?

El equipo Qwen de Alibaba publicó a mediados de agosto de 2026 (los pesos aparecieron el 14 de agosto, según la información disponible) Qwen3.8-27B, un modelo de lenguaje “denso” de unos 27.000 millones de parámetros con pesos abiertos en Hugging Face y ModelScope.

Según la ficha oficial, sus puntos clave son:

  • Licencia Apache 2.0: uso libre, también comercial.
  • Contexto de 262.144 tokens de forma nativa, ampliable hasta 1 millón con la técnica YaRN.
  • Multimodal: entiende imágenes, vídeo y documentos además de texto.
  • Modo de razonamiento activado por defecto, con un parámetro para ajustar cuánto “piensa”.

A la vez, Alibaba publicó un modelo enorme, Qwen3.8-2.4T-A95B, pero ese no es realista para un ordenador doméstico y, además, tiene una licencia propia con restricciones comerciales.

¿Se puede ejecutar en un PC normal?

Con matices. Los pesos completos ocupan unos 54-56 GB, demasiado para casi cualquier gráfica de consumo. La forma habitual de usarlo en casa es con una versión cuantizada (por ejemplo, GGUF a 4 bits), que reduce el tamaño a una fracción. La propia ficha de Hugging Face lista más de mil cuantizaciones de la comunidad compatibles con llama.cpp, Ollama, LM Studio y Jan.

Como orientación general (no son cifras oficiales de Alibaba), un modelo de 27B a 4 bits suele necesitar del orden de 16-20 GB entre pesos y contexto, así que encaja mejor en gráficas de 24 GB o en equipos con memoria unificada. Con menos VRAM puede funcionar repartiendo capas con la RAM, pero más despacio. Si quieres hacer números con tu equipo, usa nuestra herramienta ¿qué IA puedo ejecutar? y la guía de cuánta VRAM necesitas. Si la cuantización te suena a chino, empieza por qué es la cuantización GGUF.

¿Cuánto cuesta y cuándo llega a España?

El modelo es gratuito y está disponible en todo el mundo desde su publicación, incluida España. El único coste es el hardware y la electricidad si lo ejecutas en local.

¿Qué cambia frente a modelos anteriores?

Alibaba lo presenta como una mejora clara en programación, tareas profesionales y agentes que encadenan muchos pasos. En la ficha publica cifras como 61,7 en SWE-Bench Pro o 89,2 en GPQA Diamond. Hay que tomarlas con cautela: son datos del propio fabricante y eWeek señala que todavía faltan comparativas independientes en igualdad de condiciones.

¿Para quién es?

  • Para quien ya usa IA local y tiene una gráfica con mucha VRAM o un equipo con memoria unificada abundante.
  • Para desarrolladores que quieren un modelo con licencia permisiva para integrarlo en productos.
  • Para quien necesita trabajar con documentos largos o imágenes sin enviarlos a la nube.

Si es tu primera vez, empieza por instalar Ollama en Windows y prueba antes un modelo más pequeño.

Nuestra opinión

Esto es opinión. Las primeras impresiones de usuarios y analistas son muy positivas en calidad: Simon Willison lo califica de excelente para su tamaño, también en visión y en tareas de programación, y en Hacker News varios desarrolladores cuentan que acierta más a la primera que Qwen3.6 y que no da la impresión de estar optimizado solo para los benchmarks, aunque otros notan menos conocimiento general. La pega más repetida es que piensa demasiado: con el razonamiento por defecto (xhigh) genera muchísimos tokens y, a los 15-30 tokens/s que se ven en equipos domésticos, una respuesta puede tardar minutos. También se han reportado fallos en la plantilla de chat al desactivar el razonamiento y caídas de calidad fuertes por debajo de 4 bits, mientras que las pruebas de Quesma indican que la versión Q4_K_M (unos 17 GB) rinde prácticamente igual que el modelo completo. Para quien tenga una gráfica de 24 GB o un equipo con mucha memoria unificada es una de las opciones locales más interesantes, mejor en 4 bits y bajando el nivel de razonamiento; con 8 o 12 GB de VRAM la experiencia será lenta.

Preguntas frecuentes

¿Es gratis usar Qwen3.8-27B?+

Sí. Los pesos se descargan gratis y la licencia Apache 2.0 permite usarlo, modificarlo y redistribuirlo, también con fines comerciales, respetando las condiciones de la licencia.

¿Cuánto ocupa Qwen3.8-27B?+

Los pesos originales ocupan unos 54-56 GB. Para uso doméstico se usan versiones cuantizadas (GGUF y otras), que reducen mucho el tamaño a cambio de algo de calidad.

¿Funciona con Ollama o LM Studio?+

La ficha de Hugging Face enlaza versiones cuantizadas compatibles con llama.cpp, Ollama, LM Studio y Jan, publicadas por la comunidad. Conviene elegir una cuantización que quepa en tu VRAM.

¿Tiene la misma licencia el modelo grande Qwen3.8 Max?+

No. Según eWeek, el modelo grande de 2,4 billones de parámetros usa una licencia propia con límites para empresas que superen 50 millones de dólares de ingresos con ciertos servicios. El de 27B es Apache 2.0.

Fuentes

  1. Hugging Face – Qwen/Qwen3.8-27B (ficha oficial del modelo)
  2. eWeek – Alibaba Releases Qwen3.8-27B Under Apache 2.0 as Max Model Adds Licensing Limits
  3. Simon Willison – Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
  4. Thomas Wiegold – Qwen3.8-27B: the best local LLM you probably can't run
  5. Quesma – Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
  6. Hacker News – Debate sobre «Qwen3.8 27B scores 52 on Artificial Analysis»

Sigue leyendo