Serveurs & IA / Ressources / Guides / Quelle machine IA choisir
Guide · Matériel

DGX Spark, workstation ou serveur GPU : que choisir ?

Par · Publié le · Mis à jour le

Depuis l'arrivée des « mini-supercalculateurs de bureau », la question revient à chaque devis : faut-il une petite boîte à 128 Go de mémoire unifiée, une workstation avec une carte professionnelle, ou un vrai serveur ? Les trois font tourner un LLM en local. Elles ne résolvent pas du tout le même problème.

En résumé : la capacité mémoire dit ce qui rentre, la bande passante dit à quelle vitesse ça sort. Le DGX Spark offre 128 Go pour 273 Go/s ; une RTX PRO 6000 Blackwell offre 96 Go pour 1 792 Go/s, soit 6,5 fois plus de débit. Résultat : le Spark charge de gros modèles mais les fait tourner lentement — c'est une machine de prototypage, pas de production. Pour servir des utilisateurs ou des agents, c'est la carte professionnelle qui décide.

Trois catégories, trois problèmes différents

  • Le mini-supercalculateur de bureau (DGX Spark et assimilés). Une mémoire unifiée généreuse, une consommation de portable, la pile CUDA complète. Sa raison d'être : développer et prototyper en local, sur des modèles qui ne tiendraient pas dans une carte graphique classique.
  • La workstation à carte professionnelle. Une VRAM rapide avec correction d'erreurs, un débit très élevé, une machine qui reste sous un bureau. Sa raison d'être : faire tourner un modèle vite, pour une personne ou une petite équipe, et entraîner ou affiner des modèles.
  • Le serveur GPU en rack. Plusieurs cartes, redondance d'alimentation, exploitation à distance, fonctionnement continu. Sa raison d'être : servir un modèle à toute l'entreprise, ou faire tourner des agents en production 24/7.

Se tromper de catégorie coûte cher dans les deux sens : un serveur pour un développeur seul est un gâchis, un mini-PC pour servir vingt personnes est un projet qui échoue.

Le comparatif chiffré

↔ Faites défiler le tableau horizontalement

 DGX SparkWorkstation RTX PRO 6000Serveur 2 à 4 GPUDGX Station
Mémoire128 Go unifiés96 Go par carte192 à 384 Go~748 Go cohérents
TypeLPDDR5x partagéeGDDR7 ECCGDDR7 ECCHBM3e + LPDDR5X
Bande passante273 Go/s1 792 Go/s1 792 Go/s par carte7,1 To/s (côté HBM3e)
Consommation~140 W600 W (carte)1,5 à 4 kWplusieurs kW
Correction d'erreurs mémoirenonoui (ECC)oui (ECC)oui
Usage viséprototypage, devproduction mono-posteservice partagé, agentsmodèles frontière
Ordre de prix7 à 8 k€ constatés en France20 à 25 k€ HT (machine complète)dès 34 990 € HTsur devis

Prix DGX Spark relevés fin août 2026 chez les revendeurs européens ; le tarif public américain annoncé est de 4 699 $. L'écart tient à la disponibilité, très irrégulière depuis le lancement.

Le chiffre qui décide vraiment : la bande passante

C'est le point que les tableaux commerciaux escamotent, et c'est pourtant celui qui détermine si la machine sera agréable à utiliser.

La mécanique est simple. Pour produire chaque mot, le GPU doit relire l'intégralité des poids du modèle stockés en mémoire. La vitesse de génération est donc plafonnée par le débit mémoire divisé par la taille du modèle chargé :

Tokens par seconde ≈ bande passante mémoire ÷ taille du modèle en mémoire. C'est une limite physique, pas un réglage. Aucune optimisation logicielle ne la dépasse.

Appliquée aux deux machines, cette règle donne des écarts considérables — les valeurs ci-dessous sont des plafonds théoriques mono-utilisateur, la pratique se situe en dessous :

↔ Faites défiler le tableau horizontalement

Modèle (dense, 4-bit)Poids en mémoireDGX Spark — 273 Go/sRTX PRO 6000 — 1 792 Go/s
8B~11 Go~25 tok/s~160 tok/s
14B~17 Go~16 tok/s~105 tok/s
32B~22 Go~12 tok/s~80 tok/s
70B~48 Go~5 tok/s (inconfortable)~37 tok/s

Le repère à garder en tête : en dessous de 10 tokens par seconde, l'attente devient pénible ; autour de 20, la lecture suit le texte qui s'affiche ; au-delà de 40, la réponse paraît instantanée. Les mesures publiées sur un 70B dense au format 4-bit placent le DGX Spark autour de quelques tokens par seconde — conforme au calcul ci-dessus, et difficilement supportable pour un usage quotidien.

Autrement dit : le Spark charge un 70B, il ne le sert pas. La nuance change tout quand on achète pour produire.

Pourquoi nous insistons sur ce point. Une machine choisie sur sa seule capacité mémoire fait très bonne impression sur le devis et très mauvaise au premier essai. Nous préférons le dire avant la commande : une configuration qui ne convient pas au besoin réel est un échec commercial pour nous aussi. → la méthode complète de dimensionnement

Quand le DGX Spark est le bon achat

Il l'est vraiment, dans un périmètre précis :

  • Développer en local avec la pile CUDA complète, sans dépendre d'un GPU cloud pour chaque essai.
  • Prototyper sur des modèles de 7 à 40 milliards de paramètres, où le débit reste confortable.
  • Travailler en environnement fermé — site isolé, données qui ne doivent pas sortir, aucune connexion sortante.
  • Manquer de place et d'électricité. 140 W sur un bureau, sans climatisation ni prise dédiée, c'est un argument réel.
  • Préparer un déploiement plus large : ce qui tourne sur Spark se transpose ensuite sans réécriture sur une machine de production.

Quand il ne l'est pas

  • Servir plusieurs utilisateurs. Le débit est déjà juste pour une personne ; il ne se partage pas.
  • Faire tourner des agents en production. Un agent enchaîne dix à vingt appels par tâche : il subit dix à vingt fois la lenteur. → le coût réel des agents IA
  • Viser les gros modèles denses au quotidien. Ils rentrent, mais l'usage n'est pas tenable.
  • Chercher le meilleur rapport performance-prix. Au tarif européen constaté, une workstation bien dimensionnée fait souvent mieux pour un budget comparable.
  • Exiger de la mémoire à correction d'erreurs. Sur une charge longue, l'ECC n'est pas un luxe.

Vous hésitez entre deux configurations ?

Dites-nous le modèle que vous visez et le nombre de personnes à servir : on vous renvoie un dimensionnement chiffré sous 48 h, avec le débit attendu — pas seulement la fiche technique.

Faire dimensionner ma machine →

Workstation ou serveur : la vraie ligne de partage

Ce n'est ni la puissance ni le prix. C'est la question : la machine sert-elle une personne, ou un service ?

Une workstation est un poste de travail. Elle vit dans un bureau, s'éteint le soir si on veut, et son propriétaire est aussi son utilisateur. Elle convient parfaitement à un développeur, un studio, un data scientist, une petite équipe qui se partage l'accès de façon informelle.

Un serveur est une ressource partagée. Il vit dans une baie, tourne en continu, son alimentation est redondée, il se supervise et se redémarre à distance. On y bascule dès que l'indisponibilité de la machine devient un problème pour quelqu'un d'autre que son utilisateur — et c'est ce critère, pas le nombre de GPU, qui déclenche l'achat.

↔ Faites défiler le tableau horizontalement

SignalWorkstationServeur
Utilisateurs1 à 3, informelsau-delà, avec des attentes de service
Disponibilitési elle est éteinte, une personne attendsi elle est éteinte, une équipe est bloquée
Emplacementbureaulocal technique, baie
Fonctionnementheures ouvréescontinu, agents inclus
Administrationl'utilisateurà distance, supervisée

Et les alternatives à mémoire unifiée ?

Deux familles reviennent souvent dans les comparaisons, et elles méritent d'être citées honnêtement.

Les stations de travail Apple haut de gamme offrent une mémoire unifiée très large avec une bande passante nettement supérieure à celle du Spark, pour un tarif souvent inférieur. Leur limite est ailleurs : hors écosystème CUDA, une partie des outils d'entraînement, de quantization et de service d'inférence n'est pas disponible ou fonctionne en mode dégradé. Pour de l'inférence pure, c'est une option sérieuse ; pour du développement IA outillé, c'est un pari.

Les plateformes x86 à mémoire unifiée (APU récents à 128 Go partagés) se situent dans la même logique : beaucoup de mémoire, un débit modeste, un excellent rapport prix-capacité. Même verdict que le Spark, avec un écosystème logiciel moins mature.

Dans les deux cas la règle du débit s'applique à l'identique — c'est elle qui doit trancher, pas la marque.

Notre recommandation par profil

↔ Faites défiler le tableau horizontalement

Votre situationNotre recoPourquoi
Je découvre, je veux tester sans engagerCloud, puis Spark ou workstation d'entréeValider l'usage avant d'immobiliser du capital
Développeur ou studio, modèles ≤ 32BWorkstation 32 Go — dès 7 499 € HTDébit confortable, ECC, machine polyvalente
Environnement isolé, prototypage CUDADGX SparkEncombrement et consommation minimes, pile complète
Un modèle 70B pour une petite équipeWorkstation 96 Go — 20 à 25 k€ HTLe seul moyen d'obtenir un débit utilisable sur 70B
Assistant partagé, 10 à 30 personnesServeur 2 GPU — dès 34 990 € HTRequêtes en parallèle, disponibilité contractuelle
Agents en production, flux continuServeur 2 à 4 GPUDébit et concurrence, fonctionnement 24/7
Entraînement ou modèles très grandsServeur 4 GPU ou classe DGX StationCapacité mémoire agrégée et interconnexion rapide

Ce que les annonces 2026 changent

Deux mouvements sont à intégrer dans une décision d'achat cette année.

La catégorie « petite machine à grosse mémoire » se démocratise. Une déclinaison de bureau de la plateforme Spark a été annoncée pour l'automne 2026, aux côtés d'une gamme de portables construits sur la même base. Cela élargit le choix en entrée de gamme — sans changer la règle du débit : plus de mémoire ne veut toujours pas dire plus vite.

Le haut de gamme de bureau monte très haut. Une station de travail à mémoire cohérente de l'ordre de 748 Go, avec une bande passante d'un autre ordre, met des modèles de plusieurs centaines de milliards de paramètres à portée d'un local technique. C'est une catégorie de niche, mais elle existe désormais hors datacenter.

Notre conseil pratique reste le même : n'achetez pas sur une annonce. Fixez d'abord le modèle que vous devez servir et le nombre de personnes à servir. Le matériel s'en déduit, et il vieillit beaucoup mieux qu'un choix fait sur une fiche produit.

FAQ

Le DGX Spark peut-il remplacer une workstation ?

Pour du prototypage et du développement, oui. Pour un usage quotidien productif sur des modèles au-delà de 30 milliards de paramètres, non : la bande passante mémoire limite la vitesse de génération à un niveau inconfortable. La capacité annoncée et le débit réel sont deux choses différentes.

Deux cartes de 96 Go valent-elles une carte de 192 Go ?

Pas tout à fait. Le modèle est réparti entre les cartes et les échanges passent par le bus PCIe, plus lent que la mémoire embarquée. Le surcoût reste acceptable en inférence, mais on privilégie une seule grande carte quand le modèle peut y tenir entier.

Faut-il de la mémoire ECC ?

Pour une machine de production ou d'entraînement, oui. L'ECC corrige les erreurs mémoire silencieuses, celles qui ne font pas planter mais faussent un résultat ou ruinent un entraînement de plusieurs heures. Sur un poste de test, c'est moins critique.

Peut-on commencer petit et grossir ensuite ?

Oui, et c'est souvent le bon chemin : une workstation d'abord, un serveur quand le service devient partagé. La workstation ne devient pas inutile — elle redevient un poste de développement pendant que le serveur assure la production.

Quels délais de livraison ?

Nos machines sont assemblées à la commande : compter 2 à 5 semaines selon les composants, avec un délai ferme au devis. Voir les délais et l'approvisionnement.

Vous vendez du DGX Spark ?

Nous approvisionnons l'ensemble des plateformes citées ici. Mais nous ne recommandons une machine que si elle répond au besoin décrit : dans la majorité des cas d'entreprise, ce n'est pas celle qui a le plus de mémoire sur la fiche.

Un projet serveur ou IA en tête ?

Décrivez votre usage — on vous répond avec un dimensionnement et un devis sous 48 h ouvrées. Sans engagement, et si le cloud est plus pertinent dans votre cas, on vous le dira.

PowerLab — Serveurs, stockage & IA · Assemblé & opéré en France.