32 GB de VRAM para Qwen 27B: guía de hardware de IA local para octubre de 2026

Table of Contents
Que el producto indique 32 GB no significa que haya 32 GB disponibles para una carga Qwen 27B. El sistema operativo, el tiempo de ejecución, la caché KV, el formato del modelo, los controladores y la distribución de las tarjetas cambian el resultado. Una tarjeta económica con capacidad suficiente aún puede perder por mucho en el procesamiento del prompt o en el tiempo de configuración.
En octubre de 2026, compara la memoria utilizable y el trabajo completado por dólar, no solo la cifra de VRAM.
Esta guía presenta formas prácticas de ejecutar un modelo Qwen 27B con calidad de 6 bits y una ventana de contexto amplia. Separa las especificaciones publicadas de los resultados de pruebas reportados, porque el resultado de tokens por segundo de una persona no es una propiedad universal de una GPU.
Por qué el objetivo es 32 GB
El requisito de memoria empieza con los pesos. Un modelo denso de 27B lee el conjunto completo de parámetros durante la generación. Con cuantización de 6 bits, los pesos ocupan unos 20,5 GB antes de añadir las asignaciones de tiempo de ejecución y la memoria de contexto.
Un contexto de 128K tokens añade otra asignación grande. El tamaño exacto de la caché KV cambia según la arquitectura del modelo, la precisión de la caché, la configuración de lotes y el backend. Una estimación práctica cercana a 8 GB sitúa la combinación de pesos y caché en unos 28,5 GB antes de que el sistema operativo y el tiempo de ejecución de inferencia tomen su parte.
| Configuración | Qué permite |
|---|---|
| GPU discreta de 24 GB | Pesos de 4 bits con menos contexto, o descarga parcial |
| GPU discreta de 32 GB | Pesos de 6 bits con un objetivo útil de contexto 128K |
| Dos GPU de 16 GB | Modelo dividido con menos margen para el sobrecoste de ejecución |
| 64 GB de memoria unificada | Más opciones de contexto y modelo, sujeto al límite de asignación de memoria de GPU |
El objetivo de 32 GB sirve para dimensionar, no es una garantía. Un modelo puede cargarse y dejar muy poco espacio para un prompt largo, un lote mayor, entradas multimodales o un segundo proceso.
El video sirve como referencia práctica
El siguiente video compara las principales formas de llegar a 32 GB para IA local. Sirve como referencia de campo para precios reportados, dificultad de configuración y resultados de ejecución. Este artículo realiza una comparación independiente con especificaciones de hardware, comportamiento de memoria del modelo, soporte de software y coste total de propiedad.
La memoria utilizable supera a la memoria de la caja
Memoria unificada de Apple
Apple silicon usa un grupo compartido para CPU y GPU. Apple ofrece configuraciones de Mac mini con 32 GB de memoria unificada, pero todo el grupo no es una asignación gráfica dedicada. macOS, la aplicación y el tiempo de ejecución de inferencia también necesitan espacio.
Algunas sesiones de llama.cpp informan de unos 22.906 MB disponibles en un sistema de 32 GB. Son aproximadamente 21,3 GiB, lo que deja poco espacio para un modelo 27B de 6 bits con una caché KV grande. El límite exacto depende del sistema operativo, el ejecutor del modelo, la presión de memoria y las opciones de inicio.
Apple silicon sigue siendo atractiva para sistemas silenciosos. llama.cpp trata Metal como backend principal, y Apple evita los problemas de controladores y consumo de muchas tarjetas usadas de centros de datos. La desventaja es un rendimiento menor que el de una GPU discreta de alta gama y un margen de memoria menos predecible.
Dos tarjetas de 16 GB
Dos tarjetas de 16 GB proporcionan 32 GB de VRAM física, pero el tiempo de ejecución necesita buffers por dispositivo y espacio de comunicación. Una tarjeta puede informar de 13,4 GB en uso mientras la otra informa de 14,4 GB. La capacidad restante no es una reserva limpia de 4 GB para el contexto.
El método de división también importa. La división por capas asigna capas diferentes del modelo a tarjetas diferentes. Amplía la capacidad, pero las tarjetas se turnan para recorrer el modelo. La división por tensores coloca el trabajo de una misma capa en ambas tarjetas. Aumenta la comunicación, pero permite que los dos dispositivos contribuyan de forma más directa.
| Método de división | Beneficio principal | Coste principal |
|---|---|---|
| División por capas | Ampliación sencilla de capacidad | Una tarjeta suele esperar mientras trabaja la otra |
| División por tensores | Mejor cálculo paralelo en algunas cargas | Más ajustes y más tráfico entre interconexiones |
| Descarga CPU más GPU | Permite modelos que superan la VRAM total | Gran penalización cuando la CPU maneja capas frecuentes |
Un plan de dos tarjetas necesita un backend probado antes de comprar. La generación de PCIe, la separación de ranuras, la alimentación, los controladores y la cuantización exacta afectan al resultado.
Opciones de una sola tarjeta
RTX 5090
NVIDIA indica que la RTX 5090 tiene 32 GB de GDDR7 y 1.792 GB/s de ancho de banda de memoria. Ofrece amplio soporte de CUDA, herramientas maduras y muchos frontends probados. La tabla actual de GPU CUDA sitúa la RTX 5090 en una capacidad de cómputo 12.0.
El problema es el precio. Una 5090 nueva ofrece una ruta limpia a 32 GB, pero el coste de compra compite con meses de acelerador alquilado. También consume hasta 575 W de potencia gráfica total, por lo que el sistema necesita una fuente y refrigeración serias.
Radeon AI PRO R9700
La R9700 es una opción AMD de 32 GB con gran ancho de banda y un precio inicial menor que la 5090 en muchos anuncios. Su valor depende mucho del tiempo de ejecución. La ruta predeterminada de llama.cpp ofrece un resultado utilizable, mientras que un backend comunitario más rápido produce un resultado mucho mayor en la misma tarjeta en algunas pruebas reportadas.
Este es el ejemplo más claro de por qué una comparación de GPU necesita dos columnas de velocidad. La velocidad de decodificación mide los tokens generados. La velocidad de prellenado mide la rapidez con que el backend lee el prompt antes del primer token generado. Una base de código de 50.000 tokens expone un prellenado débil aunque la decodificación parezca aceptable.
Intel Arc Pro B70
La Arc Pro B70 se orienta a cargas profesionales con 32 GB de memoria. Es una opción interesante por capacidad por dólar, pero la ruta de software necesita más revisión que el hardware CUDA. El soporte GGUF estándar, las compilaciones parcheadas, los ajustes de draft-token y la madurez del backend afectan al resultado.
Un precio de compra menor no compensa las horas dedicadas a encontrar una compilación funcional. Para un aficionado, ese trabajo forma parte del proyecto. Para una estación usada a diario, el soporte de controladores y aplicaciones tiene un valor real.
Tarjetas usadas de centros de datos
Tesla V100
Las Tesla V100 usadas de 32 GB atraen porque el precio de la tarjeta parece bajo. El equipo completo cuesta más. Una tarjeta pasiva de centro de datos necesita flujo de aire, chasis o cubierta adecuados, adaptadores de alimentación y un host con espacio PCIe suficiente.
El otro problema es la antigüedad del software. La tabla actual de GPU CUDA se centra en arquitecturas nuevas y no incluye la V100 en su tabla de arquitectura actual. Antes de comprar, revisa la versión exacta de CUDA, la rama del controlador, el backend y el fork comunitario.
Presupuesta un sistema V100 funcional, no una tarjeta desnuda. Una tarjeta cercana a 680 dólares puede convertirse en un proyecto de unos 1.000 dólares después de refrigeración, adaptadores y plataforma host. Los precios usados también suben cuando una carga de IA local popular dirige a los compradores hacia el mismo acelerador retirado.
AMD Instinct MI50
La MI50 ofrece un precio usado atractivo por gigabyte, pero su soporte de software actual es una limitación seria. Una tarjeta que requiere una pila ROCm antigua o un fork comunitario no equivale a una tarjeta de consumo actual con soporte generalizado de aplicaciones.
La diferencia reportada en procesamiento del prompt importa más que el precio. Una comparación midió unos 128 tokens por segundo en una MI50 frente a unos 2.652 tokens por segundo en una tarjeta nueva de 32 GB para una carga de procesamiento del prompt. Una base de código de 50.000 tokens tardaría minutos en la ruta lenta y segundos en la rápida antes de empezar a generar.
La MI50 encaja en un caso de uso estrecho. Sirve a quien prioriza capacidad sobre velocidad de interacción y acepta mantener los controladores. Es una mala opción para analizar bases de código rápidamente cuando importa el prellenado.
El software forma parte de la GPU
llama.cpp admite CUDA, HIP, Metal, Vulkan, SYCL y otros backends. También admite inferencia híbrida CPU más GPU y varias GPU. Estas funciones no ofrecen el mismo rendimiento entre proveedores ni formatos de modelo.
La misma tarjeta física suele mostrar grandes diferencias entre:
- Una compilación de aplicación predeterminada con ajustes conservadores.
- Una compilación ajustada de llama.cpp con kernels específicos del backend.
- Un fork comunitario con predicción especulativa o de varios tokens.
- Un formato de modelo parcheado diseñado para una ruta de acelerador.
Los resultados reportados en la comparación incluyen unos 27 tokens por segundo para una ruta AMD predeterminada de 32 GB, unos 46 tokens por segundo con predicción de varios tokens y resultados mucho mayores con un backend especializado. El resultado muestra margen de software. No promete el resultado de una instalación nueva.
Registra el backend, commit, archivo del modelo, cuantización, longitud de contexto, longitud del prompt, tamaño de lote y estado de energía con cada prueba. Sin esos campos, tokens por segundo es una cifra publicitaria.
Alquilar en vez de comprar
Alquilar una GPU rápida cambia el cálculo. Un precio reportado de alquiler de RTX 5090 cercano a 0,69 dólares por hora hace que una compra de 4.400 dólares equivalga a unas 6.377 horas de alquiler antes de contar electricidad, hardware host, mantenimiento y valor de reventa.
Eso se acerca a nueve meses de alquiler continuo o unos dos años a ocho horas diarias. Un escritorio con dos tarjetas de unos 1.560 dólares equivale a unas 2.261 horas al mismo precio. La 5090 alquilada también evita calor, ruido, configuración de controladores y fallos de tarjetas locales.
| Patrón de uso | Primera prueba recomendada |
|---|---|
| Unas horas por semana | Modelo alojado o GPU alquilada |
| Proyecto corto | Alquila una tarjeta de clase 5090 y mide la carga real |
| Uso interactivo diario | Compra solo después de probar backend y contexto |
| Agentes funcionando toda la noche | El hardware propio resulta más fácil de justificar |
| Datos privados con carga estable | Hardware propio con aislamiento de red |
Alquila antes de comprar cuando el modelo, backend o contexto aún sean inciertos. Un fin de semana medido cuesta menos que comprar una estación equivocada.
Recomendaciones de compra
Dos tarjetas RTX 5060 Ti de 16 GB
Dos tarjetas de 16 GB ofrecen una ruta CUDA práctica para quien necesita 32 GB y quiere tutoriales, controladores y frontends comunes. Usa división por tensores solo después de verificar el formato del modelo y el backend. La división por capas es más sencilla, pero suele dejar rendimiento sin usar.
Esta ruta también necesita una placa base con dos ranuras utilizables, suficiente potencia y flujo de aire entre tarjetas. Un par de tarjetas deja de ser un equipo pequeño cuando incluyes el coste de la plataforma.
Una tarjeta de 32 GB
Elige una tarjeta de 32 GB cuando fiabilidad, garantía y despliegue sencillo importen más que el menor precio de memoria. La R9700 y la RTX 5090 representan versiones distintas. AMD prioriza capacidad y precio. NVIDIA prioriza amplitud de software y soporte CUDA maduro.
Una V100 o MI50 usada
Elige hardware usado de centro de datos solo cuando el proyecto incluya pruebas de controladores, refrigeración y mantenimiento del backend. El precio de la tarjeta es la primera línea del presupuesto, no la última.
Apple silicon
Elige un sistema Apple silicon de 32 GB cuando el silencio, el bajo consumo en reposo y un escritorio compacto importen más que el rendimiento máximo. Comprueba la asignación de memoria que informa el ejecutor exacto antes de asumir que los 32 GB están disponibles para el modelo.
Alquiler en la nube
Elige alquiler cuando la carga sea ocasional, el modelo cambie a menudo o la respuesta rápida al prompt importe más que la propiedad local. Apaga la instancia tras la prueba. El tiempo inactivo elimina rápido la ventaja de precio.
Una hoja de comparación mejor
Antes de comprar, registra estos valores para cada candidato:
- Memoria utilizable del modelo después del sobrecoste de ejecución.
- Formato de pesos y tamaño esperado del modelo.
- Tamaño de la caché KV con la longitud de contexto objetivo.
- Velocidad de prellenado para un prompt representativo.
- Velocidad de decodificación con el contexto lleno.
- Versión de backend y controlador necesaria para el resultado.
- Consumo en reposo y bajo carga según tu tarifa eléctrica.
- Coste del host, refrigeración, adaptadores, almacenamiento y garantía.
- Equivalente de alquiler para las horas que esperas usar el sistema.
La prueba más útil usa un prompt de tu carga real. Para programación, usa una base de código representativa. Para investigación, usa un documento largo con el flujo normal de recuperación o pegado. Mide el tiempo hasta el primer token, el procesamiento del prompt, la velocidad de generación, el uso de memoria y la calidad de salida.
Recomendación final
Compra dos RTX 5060 Ti de 16 GB para la ruta CUDA de 32 GB con menos fricción. Usa una configuración de división por tensores solo después de que una prueba pequeña confirme el backend.
Compra una tarjeta de 32 GB cuando necesites una estación más limpia. Prefiere la tarjeta con la mejor ruta de software para tu ejecutor, no la tarjeta con el menor coste por gigabyte.
Usa una V100 o MI50 solo si aceptas el proyecto de mantenimiento. Un acelerador barato con prellenado débil no es una ganga para prompts largos de bases de código.
Alquila una GPU de clase 5090 cuando el uso sea irregular. La prueba alquilada ofrece datos reales de memoria, velocidad y contexto antes de una compra grande.
La pregunta de 32 GB no es «¿qué tarjeta tiene el gigabyte más barato?». Es «¿qué sistema deja memoria utilizable suficiente, lee mi carga rápido, funciona con mi software y compensa su precio con uso habitual?»
Referencias
- Todas las formas de obtener 32 GB de VRAM para IA local con contexto completo , referencia de video para la comparación práctica anterior.
- Especificaciones de NVIDIA GeForce RTX 5090 , detalles oficiales de VRAM, ancho de banda, potencia y capacidad CUDA.
- Capacidad de cómputo de GPU CUDA de NVIDIA , tabla actual de arquitectura y capacidad de cómputo.
- Especificaciones técnicas de Apple Mac mini , configuraciones oficiales de memoria unificada y ancho de banda.
- llama.cpp , backends de inferencia compatibles y documentación de varias GPU.
- Ficha del modelo Qwen3.5 27B , referencia oficial para la familia 27B actual y el comportamiento con contexto largo.
- IA local en 2026: un modelo 27B supera a Sonnet 4.6 , análisis relacionado de modelos y hardware local.
- Pruebas de GPU de Llama 3.1 8B y Qwen3.8 27B en Vast.ai , análisis relacionado de GPU alquilada.
- El DGX Spark de 64 GB es una señal de alerta para los precios del hardware de IA local , análisis relacionado de capacidad de memoria y suministro.
Próximos pasos
Usa la hoja de trabajo con un prompt representativo antes de comprar. Compara tiempo hasta el primer token, procesamiento del prompt, decodificación, memoria, potencia y coste total de la plataforma. Para un proyecto corto, alquila primero y conserva el resultado medido con la decisión de compra.
This article refers to other articles we've written:
- El DGX Spark de 64 GB es una señal de advertencia para los precios del hardware de IA local
La versión de 64 GB del DGX Spark de NVIDIA muestra cómo la presión sobre el suministro de memoria está moldeando el hardware de IA local. Esta guía explica la reducción de capacidad, las concesiones de la memoria unificada y por qué el alivio de la DRAM es poco probable antes de finales de 2027.







