Génération locale d’images et de vidéo avec FLUX et Wan2.1
Des prompts DALL·E de 2023 à un pipeline entièrement hors ligne sur une RTX 3090
- flux
- wan2.1
- comfyui
- diffusion
- rtx-3090
Le clip en tête de cette page n’a jamais touché un service cloud. Le photogramme a été généré avec FLUX puis animé avec Wan2.1 image-to-video, le tout dans ComfyUI sur une seule NVIDIA RTX 3090 (24 Go). Il y a trois ans, la même idée consistait à écrire des prompts dans DALL·E et à attendre qu’un serveur ailleurs réponde. Cette page raconte ce changement et propose une carte pratique de ce qui tourne aujourd’hui sur du matériel grand public.
Où ça a commencé : DALL·E, 2023
En 2023, j’ai publié ici une petite galerie pour présenter la génération d’images à des collègues. Les images sortaient de DALL·E 2 via l’interface web d’OpenAI : aucun contrôle sur le modèle, pas de seeds, pas de fine-tuning possible, et chaque image quittait ma machine. C’était de la magie, et aussi une boîte noire.






Où ça en est : tout en local
Le pipeline derrière le clip compte trois étapes, toutes dans ComfyUI :
- Image — FLUX.1 [dev], fp8. 12 milliards de paramètres. En bf16, le transformer à lui seul occupe ~24 Go, ce qui ne laisse pas de place à l’encodeur de texte T5 sur une 3090 ; j’utilise donc le checkpoint fp8 (~12 Go) avec l’encodeur T5-XXL aussi en fp8. 20–28 pas à 1280×720, sampler Euler, guidance 3,5. Le rendu que vous voyez (peau naturelle, bloom de néons crédible, signalétique de style japonais cohérente) est ce qui a fait de FLUX le modèle d’image ouvert le plus utilisé.
- Vidéo — Wan2.1 I2V-14B 720p, fp8. Le photogramme entre dans le nœud
WanImageToVideoavec un court prompt de mouvement (« lent travelling avant, pluie qui tombe, il tourne légèrement la tête »). Le modèle 14B en fp8 plus l’encodeur UMT5-XXL en fp8 tiennent dans 24 Go en déchargeant l’encodeur de texte sur CPU. 49 images à 16 fps → environ trois secondes de mouvement, ensuite raccourcies en boucle. - Post — interpolation et encodage. RIFE 2× jusqu’à 24/30 fps, puis exports H.264 et VP9 pour le web.
Modèles d’image ouverts qu’on peut faire tourner à la maison
Ma liste de travail des modèles text-to-image open-weight, triable par n’importe quelle colonne. Le nom de chaque modèle renvoie à sa fiche, où figurent la licence et la documentation. « VRAM » est un chiffre pratique pour un seul GPU ; avec des poids GGUF et de l’offload, la plupart descendent plus bas, au prix de la vitesse.
| Stable Diffusion 1.5 | Runway / Stability AI | 2022-10 | ≈0.9B | 4 GB | Huge LoRA / ControlNet ecosystem, very fast |
| SDXL 1.0 | Stability AI | 2023-07 | 3.5B (base) | 8 GB | Mature fine-tunes, good composition |
| Stable Diffusion 3.5 Medium | Stability AI | 2024-10 | 2.5B | 10 GB | Balanced quality on mid-range GPUs |
| Stable Diffusion 3.5 Large | Stability AI | 2024-10 | 8B | 18 GB (bf16) / ~12 GB fp8 | Prompt adherence, typography |
| FLUX.1 [schnell] | Black Forest Labs | 2024-08 | 12B | 24 GB (bf16) / ~12 GB fp8 | 1–4 steps, fully open license |
| FLUX.1 [dev] | Black Forest Labs | 2024-08 | 12B | 24 GB (bf16) / ~12 GB fp8 | Photorealism, most popular open model |
| FLUX.1 Kontext [dev] | Black Forest Labs | 2025-06 | 12B | 24 GB (bf16) / ~12 GB fp8 | Instruction-based image editing |
| FLUX.1 Krea [dev] | Black Forest Labs × Krea | 2025-07 | 12B | 24 GB (bf16) / ~12 GB fp8 | Natural look, avoids the "AI sheen" |
| Qwen-Image | Alibaba Tongyi | 2025-08 | 20B | 20 GB fp8 / ~8 GB GGUF Q4 | Best-in-class text rendering, editing |
| Z-Image-Turbo | Alibaba Tongyi | 2025-11 | 6B | 16 GB | 8 steps, photoreal, bilingual text |
| FLUX.2 [dev] | Black Forest Labs | 2025-11 | 32B | fp8 on 24 GB RTX (with offload) | Generation + multi-reference editing in one model |
| FLUX.2 [klein] 4B | Black Forest Labs | 2026-01 | 4B | ~13 GB | Sub-second generation, fully open |
| FLUX.2 [klein] 9B | Black Forest Labs | 2026-01 | 9B | ~20 GB | Klein quality ceiling, editing |
Dernière mise à jour : 2026-09-27. Chaque modèle renvoie à sa fiche, où sont indiquées la licence et les conditions d’utilisation.
Comment je choisis. Pour le travail personnel, FLUX.1 [dev] et sa variante Krea restent mon choix par défaut pour le photoréalisme. Qwen-Image quand l’image contient du texte, Z-Image-Turbo ou FLUX.2 [klein] 4B quand je dois itérer vite et beaucoup en 16 Go. FLUX.2 [dev] est le plafond de qualité actuel pour l’édition avec plusieurs images de référence, mais à 32B il passe très juste sur une 3090.
Modèles de vidéo ouverts
La vidéo est le domaine où la génération locale est devenue intéressante en 2025. Le tableau rassemble ce que j’ai exécuté ou évalué ; la colonne VRAM reprend les chiffres de la communauté pour des cartes de 24 Go avec poids fp8/GGUF et offload, souvent très en dessous du prérequis « officiel » pour un seul GPU.
| Wan2.1 T2V-1.3B | 2025-02 | 1.3B | Text-to-video | 480p | 8 GB | Entry point; fast on any modern GPU |
| Wan2.1 I2V-14B (480p / 720p) | 2025-02 | 14B | Image-to-video | 480p or 720p, 16 fps | 24 GB (fp8 + offload) | The model behind the clip on this page |
| Wan2.2 TI2V-5B | 2025-07 | 5B | Text/Image-to-video | 720p, 24 fps | 24 GB (with offload) | High-compression VAE; fast but softer output |
| Wan2.2 T2V / I2V-A14B (MoE) | 2025-07 | 27B total / 14B active | Text-to-video, Image-to-video | 480p or 720p | 24 GB (fp8/GGUF + offload); official ≥80 GB | Two experts (high-noise / low-noise); best open quality |
| HunyuanVideo 1.5 | 2025-11 | 8.3B | Text-to-video, Image-to-video | 480p–720p, 5–10 s (+1080p super-res) | 14 GB (with offload) | Lightweight; step-distilled variants available |
| LTX-2 | 2026-01 | 19B | Text/Image-to-video with synchronized audio | Multi-scale pipeline with 2× spatial/temporal upscalers | fp8 / nvfp4 checkpoints for consumer GPUs | First open DiT to generate audio + video jointly |
Dernière mise à jour : 2026-09-27. Les chiffres de VRAM sont ceux que la communauté obtient sur des cartes de 24 Go avec fp8/GGUF et offload dans ComfyUI ; les prérequis officiels sont généralement bien plus élevés.
Pourquoi Wan2.1 pour le clip ? Parce que début 2025 c’était le premier modèle ouvert sous licence Apache-2.0 avec un checkpoint image-to-video de 14B et un workflow ComfyUI qui tenait vraiment dans 24 Go. Les modèles MoE de Wan2.2 rendent mieux mais sont plus lents sur une 3090 ; HunyuanVideo 1.5 est aujourd’hui l’option qualité la plus légère ; LTX-2 est celui à surveiller parce qu’il génère audio et vidéo à la fois.
Ce que j’en ai appris
- Les licences comptent plus que les benchmarks. Certains des meilleurs modèles n’autorisent pas l’usage commercial ; chaque fiche liée dans les tableaux indique les conditions.
- Le fp8 a tout changé pour les cartes de 24 Go. Sans lui, les transformers de diffusion de 12B–14B resteraient hors de portée d’une 3090.
- D’abord l’image, ensuite le mouvement. Obtenir un bon photogramme avec FLUX puis l’animer en I2V donne bien plus de contrôle que le text-to-video, et itérer coûte moins cher.
- ComfyUI est le système d’exploitation de ce domaine. Chaque modèle du tableau a un workflow ComfyUI quelques jours après sa sortie.
Si vous voulez le JSON du workflow qui produit le clip de cette page, demandez-le-moi sur LinkedIn.
Expériences liées

LLM en local : ce qui tient dans 16 Go face à 32 Go+
Gemma 4 12B sur un portable contre Qwen3.8-27B sur une RTX 3090 — mesuré, pas supposé

RAG privé sur votre propre machine avec turbovec
Chercher dans 177K fragments du journal officiel espagnol en local — sans cloud, sans clés d’API