IA local con una GTX 1060 de 6 GB: lo que funcionó y por qué acabé quitándola
Monté Ollama con Qwen3 en un portátil con una gráfica de 2016. Velocidades reales, la trampa de CUDA y por qué no mereció la pena para un agente.
Tengo un portátil con Linux (CachyOS), 16 GB de RAM y una NVIDIA GTX 1060 de 6 GB, una gráfica de 2016. Y tenía en una Raspberry Pi un agente de IA conectado a un servicio en la nube con un plan gratuito de 50 peticiones al día, que un agente se come en un rato.
La idea parecía buena: montar un modelo en local en el portátil y usarlo como respaldo cuando se acabaran las peticiones gratis. Lo monté, lo medí… y lo quité el mismo día. Te cuento todo, porque los números y los tropiezos pueden ahorrarte una tarde.
La trampa de CUDA con las gráficas antiguas
Primer intento: instalar Ollama con el paquete de la distribución (ollama-cuda). Se instaló bien, cargó el modelo… y iba lentísimo. Mirando los registros, Ollama había descartado la gráfica sin dar ningún error y estaba tirando de la CPU.
El motivo: ese paquete venía compilado con CUDA 13, y CUDA 13 ya no soporta la arquitectura Pascal (la de la GTX 1060, compute capability 6.1). No hay aviso claro: simplemente no la usa.
La solución fue usar el binario oficial de Ollama, que incluye librerías de CUDA 12. Además se puede extraer en tu carpeta personal (~/.local) sin permisos de administrador. Con eso, la gráfica empezó a trabajar.
Si tienes una gráfica NVIDIA de la serie 10 (Pascal) y Ollama va extrañamente lento, comprueba qué versión de CUDA trae tu paquete antes de pelearte con nada más.
Otro detalle: aunque el modelo quepa entero en la VRAM, Ollama es conservador y a veces deja capas en la CPU. Con el parámetro num_gpu 99 le dices que meta todo lo que pueda en la gráfica.
Los números
Probé dos tamaños de Qwen3, un modelo abierto que se defiende bien con herramientas:
| Modelo | Contexto | Velocidad | Dónde corre |
|---|---|---|---|
| Qwen3 8B | normal | 25,4 tokens/s | 100 % GPU |
| Qwen3 4B | 64.000 tokens | 31,3 tokens/s | 100 % GPU |
| Qwen3 8B | 64.000 tokens | 15,9 tokens/s | parte en CPU |
Para charlar, 25 tokens por segundo es más que suficiente: lees más despacio de lo que escribe. Como chat local, funcionaba bien.
Dónde se rompió: el agente
El problema no era el modelo, sino para qué lo quería. El agente que usaba exige como mínimo 64.000 tokens de contexto a cualquier modelo. Y solo su mensaje de sistema, con las descripciones de todas sus herramientas, ya ocupa unos 11.500 tokens antes de que digas nada.
Con 6 GB de VRAM, lo único que cabía entero en la gráfica con 64k de contexto era el modelo pequeño, el de 4B. Iba rápido, pero se inventaba la sintaxis de las llamadas a herramientas. El agente le pedía usar una herramienta y el modelo contestaba con un formato mal hecho, sin el nombre de la herramienta. Tres veces seguidas.
Para un agente, llamar bien a las herramientas no es un extra: es todo su trabajo. Un modelo que falla en eso no sirve, por rápido que vaya.
El de 8B con 64k habría sido probablemente suficiente, pero a 15,9 tokens/s y con parte en CPU, la experiencia ya no compensaba.
Lo que NO hay que hacer
Probé también a activar la memoria unificada (GGML_CUDA_ENABLE_UNIFIED_MEMORY=1), que permite usar la RAM normal como si fuera memoria de la gráfica. En teoría, así cabe un modelo más grande. En la práctica, tumbó el servidor de Ollama. No es una opción en esta máquina.
Y una lección de convivencia: hice pruebas pesadas mientras tenía una sesión abierta usando el portátil. La máquina dejó de responder un rato. Si vas a cargar un equipo que alguien está usando, avisa antes (aunque ese alguien seas tú en otra ventana).
Por qué lo quité
Al final de la tarde tenía:
- Un chat local que funcionaba bien, pero que no necesitaba.
- Un respaldo para el agente que no funcionaba.
- Un portátil más caliente y con menos batería.
Así que lo borré todo. «No merece la pena tenerlo si no funciona bien» fue la conclusión. Montar algo y quitarlo el mismo día no es un fracaso si te llevas los datos.
Si quieres intentarlo
- Para chatear o resumir textos en local, una GTX 1060 con un modelo de 7-8B va sobrada.
- Para agentes con muchas herramientas y contexto largo, 6 GB se quedan cortos. Busca al menos 12 GB de VRAM o un servicio en la nube.
- Usa el binario oficial de Ollama si tu gráfica es Pascal.
- Mide antes de decidir:
ollama run modelo --verbosete dice los tokens por segundo.
¿Te has quedado con la idea?
Tres preguntas rápidas. Cada acierto suma 10 XP.