DGX Spark, workstation ou serveur GPU : que choisir ?
Par PowerLab · Publié le · Mis à jour le
Depuis l'arrivée des « mini-supercalculateurs de bureau », la question revient à chaque devis : faut-il une petite boîte à 128 Go de mémoire unifiée, une workstation avec une carte professionnelle, ou un vrai serveur ? Les trois font tourner un LLM en local. Elles ne résolvent pas du tout le même problème.
Trois catégories, trois problèmes différents
- Le mini-supercalculateur de bureau (DGX Spark et assimilés). Une mémoire unifiée généreuse, une consommation de portable, la pile CUDA complète. Sa raison d'être : développer et prototyper en local, sur des modèles qui ne tiendraient pas dans une carte graphique classique.
- La workstation à carte professionnelle. Une VRAM rapide avec correction d'erreurs, un débit très élevé, une machine qui reste sous un bureau. Sa raison d'être : faire tourner un modèle vite, pour une personne ou une petite équipe, et entraîner ou affiner des modèles.
- Le serveur GPU en rack. Plusieurs cartes, redondance d'alimentation, exploitation à distance, fonctionnement continu. Sa raison d'être : servir un modèle à toute l'entreprise, ou faire tourner des agents en production 24/7.
Se tromper de catégorie coûte cher dans les deux sens : un serveur pour un développeur seul est un gâchis, un mini-PC pour servir vingt personnes est un projet qui échoue.
Le comparatif chiffré
↔ Faites défiler le tableau horizontalement
| DGX Spark | Workstation RTX PRO 6000 | Serveur 2 à 4 GPU | DGX Station | |
|---|---|---|---|---|
| Mémoire | 128 Go unifiés | 96 Go par carte | 192 à 384 Go | ~748 Go cohérents |
| Type | LPDDR5x partagée | GDDR7 ECC | GDDR7 ECC | HBM3e + LPDDR5X |
| Bande passante | 273 Go/s | 1 792 Go/s | 1 792 Go/s par carte | 7,1 To/s (côté HBM3e) |
| Consommation | ~140 W | 600 W (carte) | 1,5 à 4 kW | plusieurs kW |
| Correction d'erreurs mémoire | non | oui (ECC) | oui (ECC) | oui |
| Usage visé | prototypage, dev | production mono-poste | service partagé, agents | modèles frontière |
| Ordre de prix | 7 à 8 k€ constatés en France | 20 à 25 k€ HT (machine complète) | dès 34 990 € HT | sur devis |
Prix DGX Spark relevés fin août 2026 chez les revendeurs européens ; le tarif public américain annoncé est de 4 699 $. L'écart tient à la disponibilité, très irrégulière depuis le lancement.
Le chiffre qui décide vraiment : la bande passante
C'est le point que les tableaux commerciaux escamotent, et c'est pourtant celui qui détermine si la machine sera agréable à utiliser.
La mécanique est simple. Pour produire chaque mot, le GPU doit relire l'intégralité des poids du modèle stockés en mémoire. La vitesse de génération est donc plafonnée par le débit mémoire divisé par la taille du modèle chargé :
Appliquée aux deux machines, cette règle donne des écarts considérables — les valeurs ci-dessous sont des plafonds théoriques mono-utilisateur, la pratique se situe en dessous :
↔ Faites défiler le tableau horizontalement
| Modèle (dense, 4-bit) | Poids en mémoire | DGX Spark — 273 Go/s | RTX PRO 6000 — 1 792 Go/s |
|---|---|---|---|
| 8B | ~11 Go | ~25 tok/s | ~160 tok/s |
| 14B | ~17 Go | ~16 tok/s | ~105 tok/s |
| 32B | ~22 Go | ~12 tok/s | ~80 tok/s |
| 70B | ~48 Go | ~5 tok/s (inconfortable) | ~37 tok/s |
Le repère à garder en tête : en dessous de 10 tokens par seconde, l'attente devient pénible ; autour de 20, la lecture suit le texte qui s'affiche ; au-delà de 40, la réponse paraît instantanée. Les mesures publiées sur un 70B dense au format 4-bit placent le DGX Spark autour de quelques tokens par seconde — conforme au calcul ci-dessus, et difficilement supportable pour un usage quotidien.
Autrement dit : le Spark charge un 70B, il ne le sert pas. La nuance change tout quand on achète pour produire.
Quand le DGX Spark est le bon achat
Il l'est vraiment, dans un périmètre précis :
- Développer en local avec la pile CUDA complète, sans dépendre d'un GPU cloud pour chaque essai.
- Prototyper sur des modèles de 7 à 40 milliards de paramètres, où le débit reste confortable.
- Travailler en environnement fermé — site isolé, données qui ne doivent pas sortir, aucune connexion sortante.
- Manquer de place et d'électricité. 140 W sur un bureau, sans climatisation ni prise dédiée, c'est un argument réel.
- Préparer un déploiement plus large : ce qui tourne sur Spark se transpose ensuite sans réécriture sur une machine de production.
Quand il ne l'est pas
- Servir plusieurs utilisateurs. Le débit est déjà juste pour une personne ; il ne se partage pas.
- Faire tourner des agents en production. Un agent enchaîne dix à vingt appels par tâche : il subit dix à vingt fois la lenteur. → le coût réel des agents IA
- Viser les gros modèles denses au quotidien. Ils rentrent, mais l'usage n'est pas tenable.
- Chercher le meilleur rapport performance-prix. Au tarif européen constaté, une workstation bien dimensionnée fait souvent mieux pour un budget comparable.
- Exiger de la mémoire à correction d'erreurs. Sur une charge longue, l'ECC n'est pas un luxe.
Vous hésitez entre deux configurations ?
Dites-nous le modèle que vous visez et le nombre de personnes à servir : on vous renvoie un dimensionnement chiffré sous 48 h, avec le débit attendu — pas seulement la fiche technique.
Faire dimensionner ma machine →Workstation ou serveur : la vraie ligne de partage
Ce n'est ni la puissance ni le prix. C'est la question : la machine sert-elle une personne, ou un service ?
Une workstation est un poste de travail. Elle vit dans un bureau, s'éteint le soir si on veut, et son propriétaire est aussi son utilisateur. Elle convient parfaitement à un développeur, un studio, un data scientist, une petite équipe qui se partage l'accès de façon informelle.
Un serveur est une ressource partagée. Il vit dans une baie, tourne en continu, son alimentation est redondée, il se supervise et se redémarre à distance. On y bascule dès que l'indisponibilité de la machine devient un problème pour quelqu'un d'autre que son utilisateur — et c'est ce critère, pas le nombre de GPU, qui déclenche l'achat.
↔ Faites défiler le tableau horizontalement
| Signal | Workstation | Serveur |
|---|---|---|
| Utilisateurs | 1 à 3, informels | au-delà, avec des attentes de service |
| Disponibilité | si elle est éteinte, une personne attend | si elle est éteinte, une équipe est bloquée |
| Emplacement | bureau | local technique, baie |
| Fonctionnement | heures ouvrées | continu, agents inclus |
| Administration | l'utilisateur | à distance, supervisée |
Et les alternatives à mémoire unifiée ?
Deux familles reviennent souvent dans les comparaisons, et elles méritent d'être citées honnêtement.
Les stations de travail Apple haut de gamme offrent une mémoire unifiée très large avec une bande passante nettement supérieure à celle du Spark, pour un tarif souvent inférieur. Leur limite est ailleurs : hors écosystème CUDA, une partie des outils d'entraînement, de quantization et de service d'inférence n'est pas disponible ou fonctionne en mode dégradé. Pour de l'inférence pure, c'est une option sérieuse ; pour du développement IA outillé, c'est un pari.
Les plateformes x86 à mémoire unifiée (APU récents à 128 Go partagés) se situent dans la même logique : beaucoup de mémoire, un débit modeste, un excellent rapport prix-capacité. Même verdict que le Spark, avec un écosystème logiciel moins mature.
Dans les deux cas la règle du débit s'applique à l'identique — c'est elle qui doit trancher, pas la marque.
Notre recommandation par profil
↔ Faites défiler le tableau horizontalement
| Votre situation | Notre reco | Pourquoi |
|---|---|---|
| Je découvre, je veux tester sans engager | Cloud, puis Spark ou workstation d'entrée | Valider l'usage avant d'immobiliser du capital |
| Développeur ou studio, modèles ≤ 32B | Workstation 32 Go — dès 7 499 € HT | Débit confortable, ECC, machine polyvalente |
| Environnement isolé, prototypage CUDA | DGX Spark | Encombrement et consommation minimes, pile complète |
| Un modèle 70B pour une petite équipe | Workstation 96 Go — 20 à 25 k€ HT | Le seul moyen d'obtenir un débit utilisable sur 70B |
| Assistant partagé, 10 à 30 personnes | Serveur 2 GPU — dès 34 990 € HT | Requêtes en parallèle, disponibilité contractuelle |
| Agents en production, flux continu | Serveur 2 à 4 GPU | Débit et concurrence, fonctionnement 24/7 |
| Entraînement ou modèles très grands | Serveur 4 GPU ou classe DGX Station | Capacité mémoire agrégée et interconnexion rapide |
Ce que les annonces 2026 changent
Deux mouvements sont à intégrer dans une décision d'achat cette année.
La catégorie « petite machine à grosse mémoire » se démocratise. Une déclinaison de bureau de la plateforme Spark a été annoncée pour l'automne 2026, aux côtés d'une gamme de portables construits sur la même base. Cela élargit le choix en entrée de gamme — sans changer la règle du débit : plus de mémoire ne veut toujours pas dire plus vite.
Le haut de gamme de bureau monte très haut. Une station de travail à mémoire cohérente de l'ordre de 748 Go, avec une bande passante d'un autre ordre, met des modèles de plusieurs centaines de milliards de paramètres à portée d'un local technique. C'est une catégorie de niche, mais elle existe désormais hors datacenter.
Notre conseil pratique reste le même : n'achetez pas sur une annonce. Fixez d'abord le modèle que vous devez servir et le nombre de personnes à servir. Le matériel s'en déduit, et il vieillit beaucoup mieux qu'un choix fait sur une fiche produit.
FAQ
Le DGX Spark peut-il remplacer une workstation ?
Pour du prototypage et du développement, oui. Pour un usage quotidien productif sur des modèles au-delà de 30 milliards de paramètres, non : la bande passante mémoire limite la vitesse de génération à un niveau inconfortable. La capacité annoncée et le débit réel sont deux choses différentes.
Deux cartes de 96 Go valent-elles une carte de 192 Go ?
Pas tout à fait. Le modèle est réparti entre les cartes et les échanges passent par le bus PCIe, plus lent que la mémoire embarquée. Le surcoût reste acceptable en inférence, mais on privilégie une seule grande carte quand le modèle peut y tenir entier.
Faut-il de la mémoire ECC ?
Pour une machine de production ou d'entraînement, oui. L'ECC corrige les erreurs mémoire silencieuses, celles qui ne font pas planter mais faussent un résultat ou ruinent un entraînement de plusieurs heures. Sur un poste de test, c'est moins critique.
Peut-on commencer petit et grossir ensuite ?
Oui, et c'est souvent le bon chemin : une workstation d'abord, un serveur quand le service devient partagé. La workstation ne devient pas inutile — elle redevient un poste de développement pendant que le serveur assure la production.
Quels délais de livraison ?
Nos machines sont assemblées à la commande : compter 2 à 5 semaines selon les composants, avec un délai ferme au devis. Voir les délais et l'approvisionnement.
Vous vendez du DGX Spark ?
Nous approvisionnons l'ensemble des plateformes citées ici. Mais nous ne recommandons une machine que si elle répond au besoin décrit : dans la majorité des cas d'entreprise, ce n'est pas celle qui a le plus de mémoire sur la fiche.
Un projet serveur ou IA en tête ?
Décrivez votre usage — on vous répond avec un dimensionnement et un devis sous 48 h ouvrées. Sans engagement, et si le cloud est plus pertinent dans votre cas, on vous le dira.