AHG
Labo IA local

Génération locale d’images et de vidéo avec FLUX et Wan2.1

Des prompts DALL·E de 2023 à un pipeline entièrement hors ligne sur une RTX 3090

  • flux
  • wan2.1
  • comfyui
  • diffusion
  • rtx-3090

Aussi en: EnglishEspañol

Le clip en tête de cette page n’a jamais touché un service cloud. Le photogramme a été généré avec FLUX puis animé avec Wan2.1 image-to-video, le tout dans ComfyUI sur une seule NVIDIA RTX 3090 (24 Go). Il y a trois ans, la même idée consistait à écrire des prompts dans DALL·E et à attendre qu’un serveur ailleurs réponde. Cette page raconte ce changement et propose une carte pratique de ce qui tourne aujourd’hui sur du matériel grand public.

Où ça a commencé : DALL·E, 2023

En 2023, j’ai publié ici une petite galerie pour présenter la génération d’images à des collègues. Les images sortaient de DALL·E 2 via l’interface web d’OpenAI : aucun contrôle sur le modèle, pas de seeds, pas de fine-tuning possible, et chaque image quittait ma machine. C’était de la magie, et aussi une boîte noire.

Génération DALL·E 2, 2023
DALL·E 2 · 2023
Génération DALL·E 2, 2023
DALL·E 2 · 2023
Génération DALL·E 2, 2023
DALL·E 2 · 2023
Génération DALL·E 2, 2023
DALL·E 2 · 2023
Génération DALL·E 2, 2023
DALL·E 2 · 2023
Génération DALL·E 2, 2023
DALL·E 2 · 2023

Où ça en est : tout en local

Le pipeline derrière le clip compte trois étapes, toutes dans ComfyUI :

  1. Image — FLUX.1 [dev], fp8. 12 milliards de paramètres. En bf16, le transformer à lui seul occupe ~24 Go, ce qui ne laisse pas de place à l’encodeur de texte T5 sur une 3090 ; j’utilise donc le checkpoint fp8 (~12 Go) avec l’encodeur T5-XXL aussi en fp8. 20–28 pas à 1280×720, sampler Euler, guidance 3,5. Le rendu que vous voyez (peau naturelle, bloom de néons crédible, signalétique de style japonais cohérente) est ce qui a fait de FLUX le modèle d’image ouvert le plus utilisé.
  2. Vidéo — Wan2.1 I2V-14B 720p, fp8. Le photogramme entre dans le nœud WanImageToVideo avec un court prompt de mouvement (« lent travelling avant, pluie qui tombe, il tourne légèrement la tête »). Le modèle 14B en fp8 plus l’encodeur UMT5-XXL en fp8 tiennent dans 24 Go en déchargeant l’encodeur de texte sur CPU. 49 images à 16 fps → environ trois secondes de mouvement, ensuite raccourcies en boucle.
  3. Post — interpolation et encodage. RIFE 2× jusqu’à 24/30 fps, puis exports H.264 et VP9 pour le web.

Modèles d’image ouverts qu’on peut faire tourner à la maison

Ma liste de travail des modèles text-to-image open-weight, triable par n’importe quelle colonne. Le nom de chaque modèle renvoie à sa fiche, où figurent la licence et la documentation. « VRAM » est un chiffre pratique pour un seul GPU ; avec des poids GGUF et de l’offload, la plupart descendent plus bas, au prix de la vitesse.

Stable Diffusion 1.5Runway / Stability AI2022-10≈0.9B4 GBHuge LoRA / ControlNet ecosystem, very fast
SDXL 1.0Stability AI2023-073.5B (base)8 GBMature fine-tunes, good composition
Stable Diffusion 3.5 MediumStability AI2024-102.5B10 GBBalanced quality on mid-range GPUs
Stable Diffusion 3.5 LargeStability AI2024-108B18 GB (bf16) / ~12 GB fp8Prompt adherence, typography
FLUX.1 [schnell]Black Forest Labs2024-0812B24 GB (bf16) / ~12 GB fp81–4 steps, fully open license
FLUX.1 [dev]Black Forest Labs2024-0812B24 GB (bf16) / ~12 GB fp8Photorealism, most popular open model
FLUX.1 Kontext [dev]Black Forest Labs2025-0612B24 GB (bf16) / ~12 GB fp8Instruction-based image editing
FLUX.1 Krea [dev]Black Forest Labs × Krea2025-0712B24 GB (bf16) / ~12 GB fp8Natural look, avoids the "AI sheen"
Qwen-ImageAlibaba Tongyi2025-0820B20 GB fp8 / ~8 GB GGUF Q4Best-in-class text rendering, editing
Z-Image-TurboAlibaba Tongyi2025-116B16 GB8 steps, photoreal, bilingual text
FLUX.2 [dev]Black Forest Labs2025-1132Bfp8 on 24 GB RTX (with offload)Generation + multi-reference editing in one model
FLUX.2 [klein] 4BBlack Forest Labs2026-014B~13 GBSub-second generation, fully open
FLUX.2 [klein] 9BBlack Forest Labs2026-019B~20 GBKlein quality ceiling, editing

Dernière mise à jour : 2026-09-27. Chaque modèle renvoie à sa fiche, où sont indiquées la licence et les conditions d’utilisation.

Comment je choisis. Pour le travail personnel, FLUX.1 [dev] et sa variante Krea restent mon choix par défaut pour le photoréalisme. Qwen-Image quand l’image contient du texte, Z-Image-Turbo ou FLUX.2 [klein] 4B quand je dois itérer vite et beaucoup en 16 Go. FLUX.2 [dev] est le plafond de qualité actuel pour l’édition avec plusieurs images de référence, mais à 32B il passe très juste sur une 3090.

Modèles de vidéo ouverts

La vidéo est le domaine où la génération locale est devenue intéressante en 2025. Le tableau rassemble ce que j’ai exécuté ou évalué ; la colonne VRAM reprend les chiffres de la communauté pour des cartes de 24 Go avec poids fp8/GGUF et offload, souvent très en dessous du prérequis « officiel » pour un seul GPU.

Wan2.1 T2V-1.3B2025-021.3BText-to-video480p8 GBEntry point; fast on any modern GPU
Wan2.1 I2V-14B (480p / 720p)2025-0214BImage-to-video480p or 720p, 16 fps24 GB (fp8 + offload)The model behind the clip on this page
Wan2.2 TI2V-5B2025-075BText/Image-to-video720p, 24 fps24 GB (with offload)High-compression VAE; fast but softer output
Wan2.2 T2V / I2V-A14B (MoE)2025-0727B total / 14B activeText-to-video, Image-to-video480p or 720p24 GB (fp8/GGUF + offload); official ≥80 GBTwo experts (high-noise / low-noise); best open quality
HunyuanVideo 1.52025-118.3BText-to-video, Image-to-video480p–720p, 5–10 s (+1080p super-res)14 GB (with offload)Lightweight; step-distilled variants available
LTX-22026-0119BText/Image-to-video with synchronized audioMulti-scale pipeline with 2× spatial/temporal upscalersfp8 / nvfp4 checkpoints for consumer GPUsFirst open DiT to generate audio + video jointly

Dernière mise à jour : 2026-09-27. Les chiffres de VRAM sont ceux que la communauté obtient sur des cartes de 24 Go avec fp8/GGUF et offload dans ComfyUI ; les prérequis officiels sont généralement bien plus élevés.

Pourquoi Wan2.1 pour le clip ? Parce que début 2025 c’était le premier modèle ouvert sous licence Apache-2.0 avec un checkpoint image-to-video de 14B et un workflow ComfyUI qui tenait vraiment dans 24 Go. Les modèles MoE de Wan2.2 rendent mieux mais sont plus lents sur une 3090 ; HunyuanVideo 1.5 est aujourd’hui l’option qualité la plus légère ; LTX-2 est celui à surveiller parce qu’il génère audio et vidéo à la fois.

Ce que j’en ai appris

  • Les licences comptent plus que les benchmarks. Certains des meilleurs modèles n’autorisent pas l’usage commercial ; chaque fiche liée dans les tableaux indique les conditions.
  • Le fp8 a tout changé pour les cartes de 24 Go. Sans lui, les transformers de diffusion de 12B–14B resteraient hors de portée d’une 3090.
  • D’abord l’image, ensuite le mouvement. Obtenir un bon photogramme avec FLUX puis l’animer en I2V donne bien plus de contrôle que le text-to-video, et itérer coûte moins cher.
  • ComfyUI est le système d’exploitation de ce domaine. Chaque modèle du tableau a un workflow ComfyUI quelques jours après sa sortie.

Si vous voulez le JSON du workflow qui produit le clip de cette page, demandez-le-moi sur LinkedIn.

Expériences liées

← Retour aux expériences