Station IA 4 × RTX 5090

Logiciel et prérequis

La machine tourne sous Debian 13. Presque tout fonctionne d’origine — mais pas les cartes graphiques : c’est le seul point qui demande de sortir des dépôts Debian, et il vaut mieux le savoir avant le premier démarrage qu’après.

Le pilote de Debian ne suffit pas. Debian 13 fournit NVIDIA 550.163.01, en stable comme en backports. Or l’architecture Blackwell des RTX 5090 exige au minimum la branche 570, et seulement en module noyau ouvert : le pilote propriétaire classique ne la prend pas en charge. Le paquet nvidia-open-kernel-dkms de Debian est lui aussi en 550. Aucune combinaison de paquets Debian ne fera donc fonctionner ces cartes — il faut le dépôt CUDA de NVIDIA, qui est libre d’accès.

État des prérequis

ÉlémentÉtatDétail
Carte mère WRX90E-SAGE SEfonctionne Prise en charge complète de l’usage standard. Seuls les capteurs de carte mère (ASUS EC) attendent encore leur pilote en amont du noyau.
Réseau — 2 × Intel 10 GbEfonctionne Pilote Intel intégré au noyau, rien à installer.
Gestion à distance IPMIfonctionne Contrôleur ASPEED AST2600 sur port réseau dédié, pilote ipmi_si standard.
Mémoire ECC RDIMMfonctionne Remontée des erreurs par EDAC, sans configuration particulière.
Threadripper PRO 9955WXnoyau Ce Zen 5 « Shimada Peak » est sorti après le noyau 6.12 de Debian 13 : température et pilotage de fréquence risquent de manquer. Le noyau 7.1 des backports règle la question.
Quatre RTX 5090dépôt NVIDIA Branche 570 minimum, 580 minimum pour CUDA 13, en module noyau ouvert obligatoire. Le dépôt CUDA propose aujourd’hui la branche 615.

1 — Debian 13 et ses dépôts

Installation standard, puis activation de contrib, non-free et non-free-firmware — nécessaires aux micrologiciels — ainsi que des backports, d’où viendra le noyau.

# /etc/apt/sources.list
deb http://deb.debian.org/debian trixie main contrib non-free non-free-firmware
deb http://deb.debian.org/debian trixie-updates main contrib non-free non-free-firmware
deb http://security.debian.org/debian-security trixie-security main contrib non-free non-free-firmware
deb http://deb.debian.org/debian trixie-backports main contrib non-free non-free-firmware

sudo apt update

2 — Le noyau des backports

Debian 13 démarre sur un noyau 6.12, antérieur au processeur. Les backports proposent la série 7.1, qui connaît le Zen 5 et ses capteurs.

sudo apt install -t trixie-backports linux-image-amd64 linux-headers-amd64
sudo reboot

# après redémarrage
uname -r
sensors | grep -i tctl        # la température du processeur doit apparaître

Les en-têtes (linux-headers-amd64) ne sont pas facultatifs : le pilote NVIDIA se compile contre eux. Ils doivent venir des backports eux aussi, pour correspondre au noyau installé.

3 — Le pilote NVIDIA, depuis le dépôt CUDA

C’est l’étape qui diffère de l’habitude. Le dépôt officiel de NVIDIA pour Debian 13 est public et signé ; il n’exige aucun compte.

wget https://developer.download.nvidia.com/compute/cuda/repos/debian13/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update

# pilote en module noyau OUVERT — obligatoire pour Blackwell
sudo apt install nvidia-open

# le toolkit CUDA est séparé du pilote, et facultatif pour Ollama
sudo apt install cuda-toolkit

sudo reboot

Le paquet s’appelle bien nvidia-open, sans numéro de branche : il suit la version la plus récente du dépôt. À ne pas confondre avec nvidia-driver de Debian, qui resterait en 550 et ne verrait pas les cartes. Depuis CUDA 13.4, le pilote et le toolkit s’installent et se versionnent séparément — d’où les deux commandes distinctes.

Secure Boot. S’il est actif dans le BIOS, les modules compilés localement doivent être signés, sinon le pilote ne se chargera pas au démarrage. Le plus simple est de le désactiver sur une machine de calcul en local ; sinon, il faut inscrire une clé MOK. À trancher au premier montage, pas après l’installation.

4 — Vérifier que les quatre cartes répondent

nvidia-smi -L                 # doit lister GPU 0 à GPU 3
nvidia-smi --query-gpu=index,name,driver_version,memory.total --format=csv

# chaque carte doit être en PCIe 5.0 x16, pas en x8 ni en 4.0
nvidia-smi --query-gpu=index,pcie.link.gen.current,pcie.link.width.current --format=csv

La dernière commande mérite un regard attentif : c’est là qu’on voit si une carte a été mal engagée dans son connecteur, ou si le BIOS a réparti les lignes autrement que prévu. Avec 128 lignes PCIe 5.0 sur ce processeur, les quatre cartes doivent toutes être en x16.

Contrôler aussi la mémoire et la gestion à distance :

sudo dmidecode -t memory | grep -E "Size|Speed|Type:"   # huit modules de 32 Go
sudo modprobe ipmi_si ipmi_devintf && sudo ipmitool sensor list | head

5 — Ollama

Ollama détecte seul les cartes Blackwell, sans configuration CUDA manuelle. La version courante est la 0.34 ; l’installation officielle est un script, mais on peut aussi poser l’archive à la main pour maîtriser la version.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version

# les quatre cartes doivent apparaître au chargement d'un modèle
ollama run llama3.3:70b
nvidia-smi                    # dans un autre terminal, pendant la génération

Ollama répartit un modèle sur plusieurs cartes d’une même machine quand il ne tient pas sur une seule. Ce n’est pas de la mise en commun de mémoire : les couches sont découpées, et les échanges passent par le bus PCIe. Un modèle qui tient entièrement sur une carte reste toujours plus rapide qu’un modèle réparti — c’est l’argument des 32 Go par carte.

Ce qu’il reste à valider sur le matériel

Rien de ce qui précède n’a été éprouvé sur cette configuration : les versions citées sont celles du 13 septembre 2026 et auront bougé. À confirmer au montage : la compatibilité du BIOS PRO 9000, le comportement des quatre cartes sous charge simultanée, la remontée des capteurs de carte mère, et le choix Secure Boot. Les numéros de branche du pilote, de CUDA et d’Ollama sont à reprendre le jour de l’installation.

Sources