Station IA 4 × RTX 5090

Modèles exécutables

Avec deux cartes puis quatre, la machine charge une immense majorité des modèles du catalogue Ollama entièrement en mémoire vidéo. Tout l’enjeu tient là : tant que les poids tiennent en VRAM, la vitesse de génération reste maximale.

Configuration initiale — deux RTX 5090 (64 Go de VRAM)

Les poids sont chargés à 100 % sous les 64 Go de mémoire vidéo, épaulés par 64 Go de mémoire système.

Modèles intermédiaires, en précision maximale — plus de 100 jetons par seconde

ModèleContexteFormatSpécialité
DeepSeek-R1 32B128 KQ8 / FP16Raisonnement complexe et logique
Qwen 2.5 32B / Coder128 KQ8 / FP16Développement et agents
Gemma 2 27B8 KQ8 / FP16Polyvalence, rédaction académique
Mistral Small 22B32 KQ8 / FP16Rapidité et créativité

DeepSeek-R1 32B est un modèle de raisonnement distillé sur architecture Qwen 2.5, optimisé pour la réflexion par étapes ; en haute précision, il garde une exactitude mathématique maximale et hallucine peu sur les requêtes analytiques. Qwen 2.5 Coder 32B est la référence du code dans cette tranche de poids (88,4 % sur HumanEval) et excelle à l’orchestration d’outils externes et au JSON strict. Gemma 2 27B rivalise avec des modèles de 70B sur les connaissances générales malgré une fenêtre limitée à 8 K. Mistral Small 22B, le plus léger, atteint des vitesses extrêmes pour les échanges conversationnels.

Modèles lourds, en quantification standard — 40 à 70 jetons par seconde

ModèleContexteVRAM en Q4Spécialité
Llama 3.3 70B128 K40 à 45 GoCouteau suisse haut de gamme
DeepSeek-R1 70B128 K40 à 42 GoMathématiques et algorithmique
Qwen 2.5 72B128 K~45 GoMultilingue, traitement documentaire

Configuration cible — quatre RTX 5090 (128 Go de VRAM)

Le passage à 128 Go double la capacité mémoire et ouvre la catégorie des architectures MoE ainsi que les modèles de 70B sans aucune perte de précision.

70B à 72B sans compression

ModèleVRAM requisePrécisionSpécialité
Llama 3.3 70B75 à 140 GoQ8_0 / FP16Polyvalence, zéro compromis
DeepSeek-R1 70B75 à 80 GoQ8_0Raisonnement analytique pur
Qwen 2.5 Coder 72B75 à 80 GoQ8_0Ingénierie logicielle

Sans compression, la compréhension sémantique reste intacte sur les contextes très longs. Le cas de DeepSeek-R1 est instructif : un modèle de réflexion subit de plein fouet la dégradation de ses poids, puisqu’une simple erreur d’arrondi fait dérailler son raisonnement. En Q8_0, ses chaînes logiques et ses démonstrations s’exécutent sans dégradation.

Très grands modèles et architectures MoE — 100B à 140B

ModèleParamètresVRAM requiseSpécialité
Mixtral 8×22B141B (MoE)80 à 90 Go (Q4)Vitesse, tâches massives
Command-R+104B65 à 75 Go (Q4)Recherche documentaire et agents
Qwen 2.5 72B72B~144 Go (FP16)Maîtrise documentaire

Mixtral 8×22B n’active qu’une fraction de ses 141 milliards de paramètres par jeton : la base de connaissances d’un modèle géant, à la vitesse d’un modèle bien plus léger. Command-R+ est conçu pour la recherche augmentée : il lit des documents, en extrait l’information et cite ses sources avec précision.

Modèles géants en ultra-quantification — 405B et 671B

ModèleParamètresConfiguration requiseSpécialité
Llama 3.1 405B405B115 à 120 Go (Q2_K / IQ2_XS)Intelligence générale brute
DeepSeek-R1671B (MoE)128 Go VRAM + 128 Go RAM (IQ2)Raisonnement de niveau expert

Même lourdement compressé, Llama 3.1 405B conserve une culture générale qu’aucun modèle de 70B n’atteint, en saturant presque entièrement les 128 Go. Faire tourner DeepSeek-R1 671B demande de déborder sur les 128 Go de mémoire système via le processeur : la génération est fortement ralentie par la RAM, mais sa capacité à résoudre des problèmes de niveau doctoral reste intacte.

Par cas d’usage

Code et ingénierie logicielle

DeepSeek-R1 est nettement supérieur pour concevoir un algorithme complexe, débusquer un bug obscur ou structurer une architecture — mais avec le débordement sur la mémoire système, la génération est très lente. Llama 3.1 405B est préférable pour produire rapidement des scripts standards, commenter du code ou refactoriser.

Traitement d’un grand livre comptable

Aucun des deux géants : privilégier Qwen 2.5 Coder 72B ou Llama 3.3 70B en Q8. C’est le pire cas d’usage pour de l’ultra-quantification — la comptabilité exige une exactitude de 100 %, et la compression à 2 bits introduit des erreurs d’arrondi qui poussent le modèle à halluciner des chiffres.

Traitement d’images

Incompatibilité native : Llama 3.1 et DeepSeek-R1 sont des modèles de langage, pas des modèles de vision. Il faut passer par un modèle dédié (Llama 3.2 90B Vision, Pixtral, Qwen-VL) pour décrire l’image, puis transmettre ce texte.

Traitement de PDF

Une fois le texte extrait, Llama 3.1 405B prend l’avantage : exécuté à 100 % en mémoire vidéo, il ingère un document de cinquante pages instantanément. DeepSeek-R1 mettrait un temps prohibitif à absorber les milliers de jetons avant de générer son premier mot.

Ordre de grandeur, pas garantie. Les empreintes mémoire dépendent de la quantification retenue, de la taille du contexte alloué et du cache d’attention. Les vitesses citées supposent le modèle entièrement résident en mémoire vidéo.