AHG
Couverture abstraite : deux puces côte à côte — une petite, une grande — représentant les paliers de mémoire de 16 Go et 32 Go
Labo IA local

LLM en local : ce qui tient dans 16 Go face à 32 Go+

Gemma 4 12B sur un portable contre Qwen3.8-27B sur une RTX 3090 — mesuré, pas supposé

  • gemma-4
  • qwen3.8
  • lm-studio
  • apple-silicon
  • rtx-3090

Aussi en: EnglishEspañol

La réponse par défaut à « je veux essayer un document » est de le coller dans un chat dans le cloud. La mienne est différente : je fais tourner des modèles ouverts sur mes propres machines. Deux d’entre eux font presque tout le travail — Gemma 4 12B, qui tient dans un portable de 16 Go, et Qwen3.8-27B, qui demande un GPU de 24 Go. Tous deux résument des documents, écrivent en espagnol et en anglais, et codent assez bien pour que j’aie arrêté d’utiliser des API. La question que je voulais trancher avec des chiffres, pas avec des impressions : qu’est-ce que le grand modèle achète vraiment ?

Les deux modèles

Gemma 4 12B Qwen3.8-27B
Auteur Google DeepMind Alibaba
Taille 12B paramètres · téléchargement de 7,6 Go 27B · 18 Go
Comprend Texte, images, audio Texte, images, vidéo
Mémoire Contexte de 256K tokens 256K, extensible à 1M
Licence Gemma Terms of Use Apache-2.0 (totalement ouverte)
Tourne sur Portable de 16 Go RTX 3090 ou Mac de 32 Go+
Plus d’info Fiche du modèle · ollama gemma4 Blog de Qwen · ollama qwen3.8

En résumé : Gemma est le modèle qu’on emporte ; Qwen, celui qu’on va voir. Une machine de 16 Go plafonne autour de 12B paramètres en bonne qualité — au-delà, les poids ne rentrent tout simplement plus. Une carte de 24 Go, c’est là que commence le niveau « sérieux ».

Le test

Neuf tâches, trois exécutions chacune, les mêmes prompts des deux côtés :

  • Lire un document — un article technique d’une vingtaine de pages : rédiger un résumé exécutif, extraire des données structurées en JSON et répondre à des questions en citant les passages exacts d’où vient la réponse.
  • Écrire et traduire — un post de 600 mots en espagnol à partir d’un brief en anglais, un fil de Slack transformé en rapport formel pour la direction, et une traduction où dix termes du glossaire devaient être respectés.
  • Programmer — écrire une fonction Python avec des tests qui doivent vraiment passer, refactoriser un module TypeScript sans le casser, et diagnostiquer un stack trace.

Tout est mesuré (tokens par seconde, temps total) et chaque affirmation est vérifiée automatiquement quand c’est possible : le JSON doit être valide, les tests doivent passer, les termes du glossaire doivent apparaître. Le runner est un petit script Python qui fonctionne contre Ollama ou LM Studio, donc les chiffres sont reproductibles sur votre propre machine.

Résultats

TâcheGemma 4 12B (QAT)Mac · Apple Silicon 16 GBQwen3.8-27BPC · NVIDIA RTX 3090 24 GB
Python function + pytest8.7 tok/s✓16.9 tok/s✓
TypeScript refactor (behaviour preserved)9 tok/s✓14.8 tok/s✓
Explain a stack trace and propose a fix9 tok/s15.3 tok/s
Technical post ES from EN brief9.1 tok/s✗18.7 tok/s✓
Informal thread → formal status update9.2 tok/s14.5 tok/s
EN→ES translation with glossary8.9 tok/s✓18.3 tok/s✓
Executive summary (200 words)10.8 tok/s16.9 tok/s
Structured extraction to JSON8.5 tok/s✓18.3 tok/s✗
Grounded Q&A with citations8.9 tok/s17.6 tok/s
Dernière mise à jour: 2026-09-30✓ a réussi la vérification automatique · ✗ a échoué · — pas de vérification sur cette tâche

Ce qui m’a surpris

  • La vitesse n’est pas équitable — et pas dans le sens que j’attendais. Le modèle de 27B sur la 3090 génère à 15–19 tok/s ; le 12B sur le portable, à 8,5–11. Deux fois plus gros, presque deux fois plus rapide : la bande passante mémoire du GPU bat la pénalité de taille. Le temps total raconte la même histoire : Qwen a réécrit un fil Slack en 30 s là où Gemma a mis 95 s.
  • En code, match nul. Tous deux ont écrit une fonction correcte avec une suite de tests passée du premier coup (8 et 7 tests), et tous deux ont refactorisé le module TypeScript proprement au regard de tsc --strict. Les 15B paramètres supplémentaires ont acheté de la vitesse, pas de la justesse.
  • En lecture de documents, le meilleur et le pire moment. Tous deux ont répondu avec des citations réelles du texte, sans références inventées. Mais Qwen a brûlé ~5 900 tokens sur la tâche JSON et a renvoyé une sortie vide sur les trois exécutions : sa réponse est partie dans le canal de raisonnement caché au lieu de la réponse. Une bizarrerie du serveur, pas un défaut du modèle — et une leçon utile si vous servez des modèles « thinking » derrière des endpoints compatibles OpenAI.
  • Instructions : le grand modèle est plus strict. Tous deux ont respecté le glossaire de la traduction. Mais sur le post en espagnol, Qwen a suivi toutes les contraintes de format tandis que Gemma — propre, bon contenu — a remplacé sans permission la liste à puces demandée par des titres numérotés. Petite erreur, mais du genre à casser des pipelines.

Verdict. Si votre machine a 16 Go, Gemma 4 12B est vraiment capable : rien dans cette batterie ne lui a posé problème, et il consomme peu de mémoire. Si vous pouvez donner 24 Go à la tâche, Qwen3.8-27B est le meilleur compagnon quotidien : environ le double de débit et au moins aussi obéissant. Je garde les deux.

Expériences liées

← Retour aux expériences