
LLMs en local: qué cabe en 16 GB frente a 32 GB+
Gemma 4 12B en un portátil contra Qwen3.8-27B en una RTX 3090 — medido, no supuesto
- gemma-4
- qwen3.8
- lm-studio
- apple-silicon
- rtx-3090
La respuesta por defecto a “quiero probar un documento” es pegarlo en un chat en la nube. La mía es otra: ejecuto modelos abiertos en mis propias máquinas. Dos hacen casi todo el trabajo — Gemma 4 12B, que cabe en un portátil de 16 GB, y Qwen3.8-27B, que necesita una GPU de 24 GB. Ambos resumen documentos, escriben en español e inglés y programan lo bastante bien como para que haya dejado de recurrir a APIs. La pregunta que quería responder con números, no con impresiones: ¿qué compra realmente el modelo grande?
Los dos modelos
| Gemma 4 12B | Qwen3.8-27B | |
|---|---|---|
| Autor | Google DeepMind | Alibaba |
| Tamaño | 12B parámetros · descarga de 7,6 GB | 27B · 18 GB |
| Entiende | Texto, imágenes, audio | Texto, imágenes, vídeo |
| Memoria | Contexto de 256K tokens | 256K, ampliable a 1M |
| Licencia | Gemma Terms of Use | Apache-2.0 (totalmente abierta) |
| Funciona en | Portátil de 16 GB | RTX 3090 o Mac de 32 GB+ |
| Más info | Ficha del modelo · ollama gemma4 |
Blog de Qwen · ollama qwen3.8 |
En resumen: Gemma es el modelo que llevas contigo; Qwen, el modelo al que vas. Una máquina de 16 GB llega hasta unos 12B parámetros con buena calidad — a partir de ahí los pesos simplemente no caben. Una tarjeta de 24 GB es donde empieza el nivel “serio”.
La prueba
Nueve tareas, tres ejecuciones cada una, los mismos prompts en ambos lados:
- Leer un documento: un artículo técnico de ~20 páginas — escribir un resumen ejecutivo, extraer datos estructurados en JSON y responder preguntas citando los pasajes exactos de donde sale la respuesta.
- Escribir y traducir: un post de 600 palabras en español a partir de un brief en inglés, un hilo de Slack convertido en informe formal para dirección, y una traducción donde diez términos de glosario debían respetarse.
- Programar: escribir una función en Python con tests que deben pasar de verdad, refactorizar un módulo TypeScript sin romperlo y diagnosticar un stack trace.
Todo se mide (tokens por segundo, tiempo total) y cada afirmación se comprueba automáticamente cuando es posible: el JSON debe validar, los tests deben pasar, los términos del glosario deben aparecer. El runner es un pequeño script de Python que funciona contra Ollama o LM Studio, así que los números son reproducibles en tu propio hardware.
Resultados
| Tarea | Gemma 4 12B (QAT)Mac · Apple Silicon 16 GB | Qwen3.8-27BPC · NVIDIA RTX 3090 24 GB |
|---|---|---|
| Python function + pytest | 8.7 tok/s✓ | 16.9 tok/s✓ |
| TypeScript refactor (behaviour preserved) | 9 tok/s✓ | 14.8 tok/s✓ |
| Explain a stack trace and propose a fix | 9 tok/s | 15.3 tok/s |
| Technical post ES from EN brief | 9.1 tok/s✗ | 18.7 tok/s✓ |
| Informal thread → formal status update | 9.2 tok/s | 14.5 tok/s |
| EN→ES translation with glossary | 8.9 tok/s✓ | 18.3 tok/s✓ |
| Executive summary (200 words) | 10.8 tok/s | 16.9 tok/s |
| Structured extraction to JSON | 8.5 tok/s✓ | 18.3 tok/s✗ |
| Grounded Q&A with citations | 8.9 tok/s | 17.6 tok/s |
Lo que me sorprendió
- La velocidad no está reñida, y no en la dirección que esperaba. El modelo de 27B en la 3090 genera a 15–19 tok/s; el de 12B en el portátil, a 8,5–11. El doble de tamaño, casi el doble de velocidad: el ancho de banda de la GPU gana al tamaño. El tiempo total cuenta lo mismo: Qwen reescribió un hilo de Slack en 30 s donde Gemma tardó 95.
- En código hay empate. Ambos escribieron una función correcta con una batería de tests que pasó a la primera (8 y 7 tests), y ambos refactorizaron el módulo TypeScript limpiamente según
tsc --strict. Los 15B parámetros extra compraron velocidad, no corrección. - Leyendo documentos, el mejor y el peor momento. Ambos respondieron con citas reales del texto, sin inventarse referencias. Pero Qwen quemó ~5.900 tokens en la tarea de JSON y devolvió salida vacía en las tres ejecuciones: su respuesta se fue al canal oculto de razonamiento en lugar de a la respuesta. Una peculiaridad del servidor, no un defecto del modelo — y una lección útil si sirves modelos con razonamiento tras endpoints compatibles con OpenAI.
- Instrucciones: el grande es más estricto. Ambos respetaron el glosario de la traducción. Pero en el post en español, Qwen cumplió todas las restricciones de formato mientras que Gemma —prosa limpia, buen contenido— cambió sin permiso la lista de viñetas pedida por encabezados numerados. Un fallo pequeño, pero del tipo que rompe pipelines.
Veredicto. Si tu máquina tiene 16 GB, Gemma 4 12B es de verdad capaz: nada de esta batería le quedó grande y consume poca memoria. Si puedes darle 24 GB a la tarea, Qwen3.8-27B es mejor compañero diario: aproximadamente el doble de rendimiento y al menos igual de obediente. Yo me quedo con los dos.

