Saltar al contenido
Blog

Qwen3.8-Flash-Next en local con Strata: qué ordenador necesita tu empresa y para qué sirve

Strata es un programa gratuito que hace funcionar Qwen3.8-Flash-Next, un modelo de IA de primera línea, en un ordenador de gaming. Te explico qué es, qué ha cambiado en la versión nueva, qué equipo hace falta según el tamaño de tu empresa y para qué lo usaría yo.

Por Miguel A. Taboada
· 10 min de lectura
Qwen3.8-Flash-Next en tu PC: tarjeta gráfica de 12 GB, 64 GB de RAM y hasta 94 tokens por segundo, sin que los datos salgan de la oficina

Strata es un programa gratuito y de código abierto que hace funcionar Qwen3.8-Flash-Next, un modelo de inteligencia artificial de 125.000 millones de parámetros, en un ordenador de gaming normal: una tarjeta gráfica NVIDIA o AMD de 12 GB, 64 GB de memoria RAM y un disco SSD. Escribe a unas 50-95 palabras por segundo, lee imágenes y documentos muy largos, y nada sale del ordenador. Para una empresa de Vigo o de Galicia que maneja datos personales, es la primera vez que una IA de este nivel cabe en un equipo de oficina.

Hasta hace poco, un modelo así necesitaba un servidor con cientos de gigas de memoria gráfica, que cuesta lo mismo que un coche. Ahora se puede probar en un PC que se compra en cualquier tienda de informática. He leído la documentación de Strata y del modelo, y aquí van los datos contrastados, el equipo que haría falta y los usos que veo para un negocio de aquí.

¿Qué es Qwen3.8-Flash-Next?

Es un modelo de IA de Qwen, el equipo de inteligencia artificial de Alibaba, publicado el 26 de agosto de 2026. Sus pesos se pueden descargar desde Hugging Face. Lo esencial:

  • Es grande, pero trabaja poco a la vez. Tiene 125.000 millones de parámetros repartidos en 512 «expertos», pequeños especialistas. Para cada palabra solo se activan unos pocos, el equivalente a 6.000 millones de parámetros. Por eso puede ir rápido en un equipo modesto.
  • Lee mucho de golpe. Admite 262.144 tokens de contexto, unas 200.000 palabras: un manual técnico entero o el historial de un cliente.
  • Entiende imágenes. Puede leer fotos, capturas y documentos escaneados.
  • Está pensado para trabajar con herramientas. Qwen lo orienta a tareas de oficina largas, programación y agentes que manejan un ordenador.

En las pruebas que publica Qwen saca 62,5 en SWE-bench Pro, una prueba de programación real, por encima de los 53,4 de Claude Opus 4.6 en esa misma tabla. Son cifras del propio fabricante, así que conviene tomarlas con calma, pero lo sitúan entre los modelos abiertos más capaces del momento.

¿Qué es Strata y qué trae la versión nueva?

Strata es el programa que hace caber ese modelo en un PC. Tiene licencia MIT, funciona en Windows y Linux y se instala con un doble clic. El truco, explicado con la comparación que usa su autor, es una cocina: lo que se usa a todas horas se queda en la encimera (la tarjeta gráfica), el resto espera en la despensa (la RAM) y una gran tabla de consulta vive en el disco SSD. Además, un modelo pequeño adivina las palabras siguientes y el grande solo las comprueba, lo que acelera la respuesta entre 1,6 y 1,8 veces sin cambiarla.

La versión 0.1.39, del 4 de octubre de 2026, trae varias novedades que importan a una empresa:

  • Varias peticiones a la vez. Antes atendía a una persona y las demás esperaban. Ahora puede atender a varias en paralelo. Con cuatro tarjetas de 16 GB llega a servir 8 peticiones a la vez a 360 tokens por segundo en total.
  • Algo más rápido. Un 6 % más al escribir y hasta un 18 % más al leer documentos largos en algunos tamaños.
  • Funciona con más programas. Además de imitar la API de OpenAI y la de Anthropic, ahora entiende la que usa Codex, el asistente de programación de OpenAI.
  • Más equipos, en pruebas. Tarjetas NVIDIA antiguas, Intel Arc y procesadores viejos, de forma experimental.

Ojo: Strata va por la versión 0.1, lo mantiene una persona con ayuda de la comunidad y saca versiones casi a diario. Es muy prometedor, pero no es un producto empresarial con soporte. Para algo crítico, hay que probarlo bien antes y tener un plan B.

¿Qué ordenador hace falta para ejecutarlo?

El mínimo que pide Strata es este:

PiezaMínimoRecomendado
Tarjeta gráficaNVIDIA RTX serie 20, 30, 40 o 50, o AMD Radeon RX 7000/9000 con 12 GB24 GB o más (RTX 3090, 4090, 5090)
Memoria RAM32 GB (solo la versión para programar)64 GB: caben todos los tamaños
Disco80 GB libresSSD NVMe
SistemaWindows 10/11 o LinuxDrivers de la gráfica al día

La RAM decide qué tamaño del modelo cabe. El mismo modelo viene comprimido más o menos: los tamaños pequeños van más rápido y los grandes son algo más listos. El más grande que maneja Strata cómodamente, IQ3_S, iguala al modelo completo en las pruebas publicadas.

Estas son las velocidades que ha medido el autor:

EquipoTamañoEscribeLee
NVIDIA RTX 5070 (12 GB) + 64 GB RAMQ2_0 (el más rápido)94 tokens/s2.650 tokens/s
NVIDIA RTX 5070 (12 GB) + 64 GB RAMIQ3_S (el mejor)53 tokens/s1.620 tokens/s
AMD RX 9070 XT (16 GB) + 47 GB RAMQ2_060 tokens/s1.160 tokens/s
NVIDIA RTX 3090 (24 GB) + 64 GB RAMQ2_0 (estimado)100-140 tokens/s—

Un token es más o menos tres cuartos de palabra. A 50 tokens por segundo el texto sale más rápido de lo que se lee.

Qué equipo elegiría según el tamaño de la empresa

  • Para probar o para una sola persona: un PC de gaming con RTX 5070 o similar de 12-16 GB, 64 GB de RAM y un SSD de 1-2 TB. Es la configuración que usa el propio autor. Atiende a una persona cada vez.
  • Para un equipo pequeño (3-10 personas): una tarjeta de 24-32 GB (RTX 3090 de segunda mano, 4090 o 5090) y 64-96 GB de RAM. Con más memoria gráfica caben más expertos en la tarjeta y Strata recomienda atender 3 o 4 peticiones a la vez.
  • Para un departamento o agentes trabajando sin parar: un servidor con dos a cuatro tarjetas, o una estación de trabajo con una tarjeta profesional de 96 GB. Ahí ya se puede usar el modelo a 4 bits y repartirlo entre varios usuarios.
  • Si en la oficina hay Mac: Strata no funciona en Mac. Un Mac Studio con 96-128 GB de memoria puede mover el modelo con otras herramientas como Ollama o llama.cpp, que es lo que recomienda Unsloth en su guía.

Lo que no cuentan los anuncios: la primera vez que arranca, el ordenador puede quedarse congelado de uno a tres minutos mientras carga 35-55 GB en memoria. Y mientras el modelo está en marcha, ese PC está ocupado: no es buena idea que sea también el equipo de trabajo de alguien.

¿Para qué lo usaría una empresa?

La gran ventaja no es el precio. Usar este mismo modelo por internet en la nube de Qwen cuesta unos 0,16 dólares por millón de tokens de entrada, casi nada. La ventaja es otra: los datos no salen de tu oficina, no dependes de que un proveedor cambie precios o condiciones y puedes dejarlo trabajando toda la noche sin mirar la factura. Estos son los usos que veo más claros:

  1. Asesorías y despachos: resumir expedientes, clasificar correos y preparar borradores de respuesta con nombres, DNI y cifras que no deberían viajar a servidores de fuera.
  2. Clínicas y centros de salud: pasar a limpio notas de consulta o preparar borradores de informes. Con datos de salud, que el texto no salga del edificio simplifica mucho el RGPD.
  3. Industria y naval: cargar un manual técnico entero o la documentación de una máquina y preguntarle en lenguaje normal. Con 262.000 tokens de contexto cabe casi cualquier manual.
  4. Administración y compras: leer fotos de albaranes y facturas escaneadas, sacar los datos y dejarlos listos para el programa de gestión.
  5. Comercio y tiendas online: redactar o traducir fichas de producto por lotes. Al no pagar por uso, se pueden rehacer las veces que haga falta.
  6. Programación interna: Strata se conecta con asistentes como Claude Code o Codex, y tiene una versión «Coder» pensada para programar que cabe en un PC de 32 GB.
  7. Un asistente interno con lo que sabe la empresa: procedimientos, tarifas, preguntas frecuentes de clientes. Cualquier programa que funcione con la API de OpenAI se puede apuntar a este ordenador cambiando una dirección.

Ejemplo hipotético: una gestoría de Vigo con seis personas recibe cada mañana una pila de correos con nóminas y facturas adjuntas. Un PC con una RTX 3090 y 96 GB de RAM, en un rincón de la oficina, lee los correos de madrugada, separa lo urgente, saca los datos de cada factura y deja un borrador de respuesta para cada cliente. Por la mañana, el equipo revisa y envía. Ningún documento ha salido del edificio.

¿Qué hay que tener en cuenta antes?

  • La licencia permite el uso comercial. El modelo tiene la licencia Qwen Community 1.0: se puede usar en tu negocio sin pagar nada. Solo pide una licencia aparte si vendes el modelo como servicio a terceros, y mostrar su nombre si tu producto supera los 100 millones de usuarios al mes.
  • Comprimido no es lo mismo que completo. Los tamaños más pequeños pierden algo de calidad. Para tareas delicadas, mejor IQ3_S, que necesita 64 GB de RAM o más.
  • Prueba el gallego. El modelo funciona bien en español. La versión Coder, según el propio proyecto, flojea fuera del inglés. Si tu empresa trabaja en gallego, haz pruebas antes de fiarte.
  • Si lo abres a la red, pon contraseña. Strata puede atender a otros ordenadores de la oficina, pero hay que configurar una clave para que nadie más lo use.
  • Que sea local no lo hace infalible. Como cualquier IA, puede equivocarse. Lo que redacte debe revisarlo una persona antes de enviarlo a un cliente.

¿Merece la pena para mi negocio?

Mi consejo práctico:

  • Sí, si manejas datos sensibles y hasta ahora no te atrevías a usar IA por miedo a dónde acaban. Es justo el caso para el que más sentido tiene.
  • Sí, si tienes trabajo repetitivo en volumen que se puede dejar corriendo por la noche.
  • Mejor espera, si solo quieres un chat para dudas sueltas. Para eso, un servicio en la nube es más cómodo y, con datos no sensibles, más barato que comprar un equipo.

Además, montar un proyecto así encaja con el bono de IA del Plan IA360, que pagará proyectos que cambien procesos, no suscripciones. Si quieres probar una IA que no saque tus datos de la oficina, puedo montarla y conectarla a tus programas desde Vigo. Mira cómo trabajo las automatizaciones a medida.

Preguntas frecuentes

¿Qué es Qwen3.8-Flash-Next?

Es un modelo de inteligencia artificial de Qwen (Alibaba), publicado el 26 de agosto de 2026. Tiene 125.000 millones de parámetros, de los que solo usa unos 6.000 millones en cada palabra, lee imágenes y admite 262.144 tokens de contexto.

¿Qué es Strata?

Es un programa gratuito y de código abierto (licencia MIT) que permite ejecutar Qwen3.8-Flash-Next en un PC con Windows o Linux y una tarjeta gráfica de 12 GB o más. Reparte el modelo entre la tarjeta gráfica, la RAM y el disco.

¿Qué ordenador necesito para usar Qwen3.8-Flash-Next en local?

Con Strata, una tarjeta NVIDIA RTX de las series 20 a 50 o una AMD Radeon reciente con 12 GB, 64 GB de RAM y unos 80 GB libres en un SSD. Con 32 GB de RAM solo cabe la versión para programar.

¿Funciona en Mac?

Strata no. En un Mac con 96 GB de memoria o más se puede ejecutar el modelo con otras herramientas, como Ollama o llama.cpp.

¿Se puede usar en una empresa?

Sí. La licencia Qwen Community 1.0 permite el uso comercial. Solo hace falta una licencia aparte para vender el modelo como servicio a terceros.

¿Mis datos salen del ordenador?

No. El modelo funciona entero en tu equipo y no necesita internet para responder. Solo se conecta para descargarlo la primera vez y para actualizarse.

Miguel A. Taboada

Miguel A. Taboada

Diseño y desarrollo webs, apps e IA útil desde Vigo. Escribo sobre lo que veo cada semana cuidando webs de artistas, escuelas y pymes.