Modèles exécutables
Avec deux cartes puis quatre, la machine charge une immense majorité des modèles du catalogue Ollama entièrement en mémoire vidéo. Tout l’enjeu tient là : tant que les poids tiennent en VRAM, la vitesse de génération reste maximale.
Configuration initiale — deux RTX 5090 (64 Go de VRAM)
Les poids sont chargés à 100 % sous les 64 Go de mémoire vidéo, épaulés par 64 Go de mémoire système.
Modèles intermédiaires, en précision maximale — plus de 100 jetons par seconde
| Modèle | Contexte | Format | Spécialité |
|---|---|---|---|
| DeepSeek-R1 32B | 128 K | Q8 / FP16 | Raisonnement complexe et logique |
| Qwen 2.5 32B / Coder | 128 K | Q8 / FP16 | Développement et agents |
| Gemma 2 27B | 8 K | Q8 / FP16 | Polyvalence, rédaction académique |
| Mistral Small 22B | 32 K | Q8 / FP16 | Rapidité et créativité |
DeepSeek-R1 32B est un modèle de raisonnement distillé sur architecture Qwen 2.5, optimisé pour la réflexion par étapes ; en haute précision, il garde une exactitude mathématique maximale et hallucine peu sur les requêtes analytiques. Qwen 2.5 Coder 32B est la référence du code dans cette tranche de poids (88,4 % sur HumanEval) et excelle à l’orchestration d’outils externes et au JSON strict. Gemma 2 27B rivalise avec des modèles de 70B sur les connaissances générales malgré une fenêtre limitée à 8 K. Mistral Small 22B, le plus léger, atteint des vitesses extrêmes pour les échanges conversationnels.
Modèles lourds, en quantification standard — 40 à 70 jetons par seconde
| Modèle | Contexte | VRAM en Q4 | Spécialité |
|---|---|---|---|
| Llama 3.3 70B | 128 K | 40 à 45 Go | Couteau suisse haut de gamme |
| DeepSeek-R1 70B | 128 K | 40 à 42 Go | Mathématiques et algorithmique |
| Qwen 2.5 72B | 128 K | ~45 Go | Multilingue, traitement documentaire |
Configuration cible — quatre RTX 5090 (128 Go de VRAM)
Le passage à 128 Go double la capacité mémoire et ouvre la catégorie des architectures MoE ainsi que les modèles de 70B sans aucune perte de précision.
70B à 72B sans compression
| Modèle | VRAM requise | Précision | Spécialité |
|---|---|---|---|
| Llama 3.3 70B | 75 à 140 Go | Q8_0 / FP16 | Polyvalence, zéro compromis |
| DeepSeek-R1 70B | 75 à 80 Go | Q8_0 | Raisonnement analytique pur |
| Qwen 2.5 Coder 72B | 75 à 80 Go | Q8_0 | Ingénierie logicielle |
Sans compression, la compréhension sémantique reste intacte sur les contextes très longs. Le cas de DeepSeek-R1 est instructif : un modèle de réflexion subit de plein fouet la dégradation de ses poids, puisqu’une simple erreur d’arrondi fait dérailler son raisonnement. En Q8_0, ses chaînes logiques et ses démonstrations s’exécutent sans dégradation.
Très grands modèles et architectures MoE — 100B à 140B
| Modèle | Paramètres | VRAM requise | Spécialité |
|---|---|---|---|
| Mixtral 8×22B | 141B (MoE) | 80 à 90 Go (Q4) | Vitesse, tâches massives |
| Command-R+ | 104B | 65 à 75 Go (Q4) | Recherche documentaire et agents |
| Qwen 2.5 72B | 72B | ~144 Go (FP16) | Maîtrise documentaire |
Mixtral 8×22B n’active qu’une fraction de ses 141 milliards de paramètres par jeton : la base de connaissances d’un modèle géant, à la vitesse d’un modèle bien plus léger. Command-R+ est conçu pour la recherche augmentée : il lit des documents, en extrait l’information et cite ses sources avec précision.
Modèles géants en ultra-quantification — 405B et 671B
| Modèle | Paramètres | Configuration requise | Spécialité |
|---|---|---|---|
| Llama 3.1 405B | 405B | 115 à 120 Go (Q2_K / IQ2_XS) | Intelligence générale brute |
| DeepSeek-R1 | 671B (MoE) | 128 Go VRAM + 128 Go RAM (IQ2) | Raisonnement de niveau expert |
Même lourdement compressé, Llama 3.1 405B conserve une culture générale qu’aucun modèle de 70B n’atteint, en saturant presque entièrement les 128 Go. Faire tourner DeepSeek-R1 671B demande de déborder sur les 128 Go de mémoire système via le processeur : la génération est fortement ralentie par la RAM, mais sa capacité à résoudre des problèmes de niveau doctoral reste intacte.
Par cas d’usage
Code et ingénierie logicielle
DeepSeek-R1 est nettement supérieur pour concevoir un algorithme complexe, débusquer un bug obscur ou structurer une architecture — mais avec le débordement sur la mémoire système, la génération est très lente. Llama 3.1 405B est préférable pour produire rapidement des scripts standards, commenter du code ou refactoriser.
Traitement d’un grand livre comptable
Aucun des deux géants : privilégier Qwen 2.5 Coder 72B ou Llama 3.3 70B en Q8. C’est le pire cas d’usage pour de l’ultra-quantification — la comptabilité exige une exactitude de 100 %, et la compression à 2 bits introduit des erreurs d’arrondi qui poussent le modèle à halluciner des chiffres.
Traitement d’images
Incompatibilité native : Llama 3.1 et DeepSeek-R1 sont des modèles de langage, pas des modèles de vision. Il faut passer par un modèle dédié (Llama 3.2 90B Vision, Pixtral, Qwen-VL) pour décrire l’image, puis transmettre ce texte.
Traitement de PDF
Une fois le texte extrait, Llama 3.1 405B prend l’avantage : exécuté à 100 % en mémoire vidéo, il ingère un document de cinquante pages instantanément. DeepSeek-R1 mettrait un temps prohibitif à absorber les milliers de jetons avant de générer son premier mot.