Qwen3.8-Flash-Next en local con Strata: que ordenador precisa a túa empresa e para que serve
Strata é un programa gratuíto que fai funcionar Qwen3.8-Flash-Next, un modelo de IA de primeira liña, nun ordenador de gaming. Cóntoche que é, que cambiou na versión nova, que equipo fai falta segundo o tamaño da túa empresa e para que o usaría eu.
Strata é un programa gratuíto e de código aberto que fai funcionar Qwen3.8-Flash-Next, un modelo de intelixencia artificial de 125.000 millóns de parámetros, nun ordenador de gaming normal: unha tarxeta gráfica NVIDIA ou AMD de 12 GB, 64 GB de memoria RAM e un disco SSD. Escribe a unhas 50-95 palabras por segundo, le imaxes e documentos moi longos, e nada sae do ordenador. Para unha empresa de Vigo ou de Galicia que manexa datos persoais, é a primeira vez que unha IA deste nivel cabe nun equipo de oficina.
Ata hai pouco, un modelo así necesitaba un servidor con centos de gigas de memoria gráfica, que custa o mesmo ca un coche. Agora pódese probar nun PC que se compra en calquera tenda de informática. Lin a documentación de Strata e do modelo, e velaquí os datos contrastados, o equipo que faría falta e os usos que vexo para un negocio de aquí.
Que é Qwen3.8-Flash-Next?
É un modelo de IA de Qwen, o equipo de intelixencia artificial de Alibaba, publicado o 26 de agosto de 2026. Os seus pesos pódense descargar desde Hugging Face. O esencial:
- É grande, pero traballa pouco á vez. Ten 125.000 millóns de parámetros repartidos en 512 «expertos», pequenos especialistas. Para cada palabra só se activan uns poucos, o equivalente a 6.000 millóns de parámetros. Por iso pode ir rápido nun equipo modesto.
- Le moito dunha vez. Admite 262.144 tokens de contexto, unhas 200.000 palabras: un manual técnico enteiro ou o historial dun cliente.
- Entende imaxes. Pode ler fotos, capturas e documentos escaneados.
- Está pensado para traballar con ferramentas. Qwen oriéntao a tarefas de oficina longas, programación e axentes que manexan un ordenador.
Nas probas que publica Qwen saca 62,5 en SWE-bench Pro, unha proba de programación real, por riba dos 53,4 de Claude Opus 4.6 nesa mesma táboa. Son cifras do propio fabricante, así que convén tomalas con calma, pero sitúano entre os modelos abertos máis capaces do momento.
Que é Strata e que trae a versión nova?
Strata é o programa que fai caber ese modelo nun PC. Ten licenza MIT, funciona en Windows e Linux e instálase cun dobre clic. O truco, explicado coa comparación que usa o seu autor, é unha cociña: o que se usa a todas horas queda na bancada (a tarxeta gráfica), o resto agarda na despensa (a RAM) e unha gran táboa de consulta vive no disco SSD. Ademais, un modelo pequeno adiviña as palabras seguintes e o grande só as comproba, o que acelera a resposta entre 1,6 e 1,8 veces sen cambiala.
A versión 0.1.39, do 4 de outubro de 2026, trae varias novidades que importan a unha empresa:
- Varias peticións á vez. Antes atendía a unha persoa e as demais agardaban. Agora pode atender a varias en paralelo. Con catro tarxetas de 16 GB chega a servir 8 peticións á vez a 360 tokens por segundo en total.
- Algo máis rápido. Un 6 % máis ao escribir e ata un 18 % máis ao ler documentos longos nalgúns tamaños.
- Funciona con máis programas. Ademais de imitar a API de OpenAI e a de Anthropic, agora entende a que usa Codex, o asistente de programación de OpenAI.
- Máis equipos, en probas. Tarxetas NVIDIA antigas, Intel Arc e procesadores vellos, de forma experimental.
Ollo: Strata vai pola versión 0.1, mantéñeo unha persoa con axuda da comunidade e saca versións case a diario. É moi prometedor, pero non é un produto empresarial con soporte. Para algo crítico, hai que probalo ben antes e ter un plan B.
Que ordenador fai falta para executalo?
O mínimo que pide Strata é este:
| Peza | Mínimo | Recomendado |
|---|---|---|
| Tarxeta gráfica | NVIDIA RTX serie 20, 30, 40 ou 50, ou AMD Radeon RX 7000/9000 con 12 GB | 24 GB ou máis (RTX 3090, 4090, 5090) |
| Memoria RAM | 32 GB (só a versión para programar) | 64 GB: caben todos os tamaños |
| Disco | 80 GB libres | SSD NVMe |
| Sistema | Windows 10/11 ou Linux | Drivers da gráfica ao día |
A RAM decide que tamaño do modelo cabe. O mesmo modelo vén comprimido máis ou menos: os tamaños pequenos van máis rápido e os grandes son algo máis listos. O máis grande que manexa Strata comodamente, IQ3_S, iguala o modelo completo nas probas publicadas.
Estas son as velocidades que mediu o autor:
| Equipo | Tamaño | Escribe | Le |
|---|---|---|---|
| NVIDIA RTX 5070 (12 GB) + 64 GB RAM | Q2_0 (o máis rápido) | 94 tokens/s | 2.650 tokens/s |
| NVIDIA RTX 5070 (12 GB) + 64 GB RAM | IQ3_S (o mellor) | 53 tokens/s | 1.620 tokens/s |
| AMD RX 9070 XT (16 GB) + 47 GB RAM | Q2_0 | 60 tokens/s | 1.160 tokens/s |
| NVIDIA RTX 3090 (24 GB) + 64 GB RAM | Q2_0 (estimado) | 100-140 tokens/s | — |
Un token é máis ou menos tres cuartos de palabra. A 50 tokens por segundo o texto sae máis rápido do que se le.
Que equipo escollería segundo o tamaño da empresa
- Para probar ou para unha soa persoa: un PC de gaming con RTX 5070 ou similar de 12-16 GB, 64 GB de RAM e un SSD de 1-2 TB. É a configuración que usa o propio autor. Atende a unha persoa cada vez.
- Para un equipo pequeno (3-10 persoas): unha tarxeta de 24-32 GB (RTX 3090 de segunda man, 4090 ou 5090) e 64-96 GB de RAM. Con máis memoria gráfica caben máis expertos na tarxeta e Strata recomenda atender 3 ou 4 peticións á vez.
- Para un departamento ou axentes traballando sen parar: un servidor con dúas a catro tarxetas, ou unha estación de traballo cunha tarxeta profesional de 96 GB. Aí xa se pode usar o modelo a 4 bits e repartilo entre varios usuarios.
- Se na oficina hai Mac: Strata non funciona en Mac. Un Mac Studio con 96-128 GB de memoria pode mover o modelo con outras ferramentas como Ollama ou llama.cpp, que é o que recomenda Unsloth na súa guía.
O que non contan os anuncios: a primeira vez que arranca, o ordenador pode quedar conxelado de un a tres minutos mentres carga 35-55 GB en memoria. E mentres o modelo está en marcha, ese PC está ocupado: non é boa idea que sexa tamén o equipo de traballo de alguén.
Para que o usaría unha empresa?
A gran vantaxe non é o prezo. Usar este mesmo modelo por internet na nube de Qwen custa uns 0,16 dólares por millón de tokens de entrada, case nada. A vantaxe é outra: os datos non saen da túa oficina, non dependes de que un provedor cambie prezos ou condicións e podes deixalo traballando toda a noite sen mirar a factura. Estes son os usos que vexo máis claros:
- Asesorías e despachos: resumir expedientes, clasificar correos e preparar borradores de resposta con nomes, DNI e cifras que non deberían viaxar a servidores de fóra.
- Clínicas e centros de saúde: pasar a limpo notas de consulta ou preparar borradores de informes. Con datos de saúde, que o texto non saia do edificio simplifica moito o RGPD.
- Industria e naval: cargar un manual técnico enteiro ou a documentación dunha máquina e preguntarlle en linguaxe normal. Con 262.000 tokens de contexto cabe case calquera manual.
- Administración e compras: ler fotos de albarás e facturas escaneadas, sacar os datos e deixalos listos para o programa de xestión.
- Comercio e tendas en liña: redactar ou traducir fichas de produto por lotes. Ao non pagar por uso, pódense refacer as veces que faga falta.
- Programación interna: Strata conéctase con asistentes como Claude Code ou Codex, e ten unha versión «Coder» pensada para programar que cabe nun PC de 32 GB.
- Un asistente interno co que sabe a empresa: procedementos, tarifas, preguntas frecuentes de clientes. Calquera programa que funcione coa API de OpenAI pódese apuntar a este ordenador cambiando un enderezo.
Exemplo hipotético: unha xestoría de Vigo con seis persoas recibe cada mañá unha morea de correos con nóminas e facturas anexas. Un PC cunha RTX 3090 e 96 GB de RAM, nun recuncho da oficina, le os correos de madrugada, separa o urxente, saca os datos de cada factura e deixa un borrador de resposta para cada cliente. Pola mañá, o equipo revisa e envía. Ningún documento saíu do edificio.
Que hai que ter en conta antes?
- A licenza permite o uso comercial. O modelo ten a licenza Qwen Community 1.0: pódese usar no teu negocio sen pagar nada. Só pide unha licenza aparte se vendes o modelo como servizo a terceiros, e amosar o seu nome se o teu produto supera os 100 millóns de usuarios ao mes.
- Comprimido non é o mesmo que completo. Os tamaños máis pequenos perden algo de calidade. Para tarefas delicadas, mellor IQ3_S, que necesita 64 GB de RAM ou máis.
- Proba o galego. O modelo funciona ben en castelán. A versión Coder, segundo o propio proxecto, flaquea fóra do inglés. Se a túa empresa traballa en galego, fai probas antes de fiarte.
- Se o abres á rede, pon contrasinal. Strata pode atender a outros ordenadores da oficina, pero hai que configurar unha clave para que ninguén máis o use.
- Que sexa local non o fai infalible. Como calquera IA, pode equivocarse. O que redacte debe revisalo unha persoa antes de envialo a un cliente.
Paga a pena para o meu negocio?
O meu consello práctico:
- Si, se manexas datos sensibles e ata agora non te atrevías a usar IA por medo a onde acaban. É xusto o caso para o que máis sentido ten.
- Si, se tes traballo repetitivo en volume que se pode deixar correndo pola noite.
- Mellor agarda, se só queres un chat para dúbidas soltas. Para iso, un servizo na nube é máis cómodo e, con datos non sensibles, máis barato que mercar un equipo.
Ademais, montar un proxecto así encaixa co bono de IA do Plan IA360, que pagará proxectos que cambien procesos, non subscricións. Se queres probar unha IA que non saque os teus datos da oficina, podo montala e conectala aos teus programas desde Vigo. Mira como traballo as automatizacións á medida.
Preguntas frecuentes
Que é Qwen3.8-Flash-Next?
É un modelo de intelixencia artificial de Qwen (Alibaba), publicado o 26 de agosto de 2026. Ten 125.000 millóns de parámetros, dos que só usa uns 6.000 millóns en cada palabra, le imaxes e admite 262.144 tokens de contexto.
Que é Strata?
É un programa gratuíto e de código aberto (licenza MIT) que permite executar Qwen3.8-Flash-Next nun PC con Windows ou Linux e unha tarxeta gráfica de 12 GB ou máis. Reparte o modelo entre a tarxeta gráfica, a RAM e o disco.
Que ordenador necesito para usar Qwen3.8-Flash-Next en local?
Con Strata, unha tarxeta NVIDIA RTX das series 20 a 50 ou unha AMD Radeon recente con 12 GB, 64 GB de RAM e uns 80 GB libres nun SSD. Con 32 GB de RAM só cabe a versión para programar.
Funciona en Mac?
Strata non. Nun Mac con 96 GB de memoria ou máis pódese executar o modelo con outras ferramentas, como Ollama ou llama.cpp.
Pódese usar nunha empresa?
Si. A licenza Qwen Community 1.0 permite o uso comercial. Só fai falta unha licenza aparte para vender o modelo como servizo a terceiros.
Os meus datos saen do ordenador?
Non. O modelo funciona enteiro no teu equipo e non necesita internet para responder. Só se conecta para descargalo a primeira vez e para actualizarse.
Miguel A. Taboada
Deseño e desenvolvo webs, apps e IA útil desde Vigo. Escribo sobre o que vexo cada semana coidando webs de artistas, escolas e pemes.