Combien coûte un LLM en local vs cloud ?
Par PowerLab · Publié le · Mis à jour le
C'est la vraie question derrière « faut-il internaliser son IA ». Ce guide décompose les coûts des deux côtés, vous donne le seuil de rentabilité, et un calculateur pour votre cas précis.
Le coût côté cloud
Louer un GPU dans le cloud, c'est un tarif horaire. Fin 2024, un H100 coûtait 8-10 $/h ; début 2026, les prix ont chuté de 60-75 % et tournent autour de 2 €/h en libre-service (jusqu'à ~3 € en premium), moins en spot.
Le piège : c'est récurrent. Un modèle qui doit rester disponible pour une équipe tourne, en pratique, une grande partie de la journée — voire 24/7. À 2 €/h en continu, on parle de ~1 460 €/mois, soit ~17 500 €/an… qui ne s'arrêtent jamais.
Le coût côté local
Une infrastructure locale, c'est un coût fixe amorti :
- Matériel : une workstation capable de servir un 70B se situe autour de 18-25 k€ ; un serveur GPU multi-utilisateurs, 35-70 k€.
- Amortissement : étalé sur 3 ans, un poste à 18 k€ revient à 500 €/mois.
- Électricité : une machine sous charge consomme ~1 kW ; en France, à ~0,20 €/kWh, quelques dizaines d'euros par mois.
- Maintenance : à votre charge, ou infogérée (forfait).
Une fois la machine payée, chaque heure d'inférence supplémentaire ne coûte quasiment rien.
Location de GPU ou facturation au token : deux modèles très différents
Attention à ne pas confondre deux façons de payer le cloud, car elles ne basculent pas au même moment.
La location de GPU à l'heure
Vous réservez une carte et vous payez le temps, qu'elle calcule ou non. C'est le modèle des fournisseurs d'infrastructure. Simple à comparer avec du matériel : même unité, même logique. Le piège est l'inactivité — un GPU réservé pour rester disponible facture aussi les heures où personne ne l'utilise.
La facturation au token
C'est le modèle des API (OpenAI, Anthropic, Mistral…). Vous ne payez que ce que vous consommez, ce qui est imbattable en usage faible. Mais la facture suit le volume, et surtout : vous payez aussi ce que vous envoyez. Un token correspond à environ trois quarts de mot en français, et le tarif d'entrée s'applique à la question, à l'historique de conversation et aux documents joints.
Le coût total, celui qu'on oublie de compter
Comparer « prix de la machine » et « facture cloud » est incomplet des deux côtés. Voici les postes à intégrer pour un calcul honnête.
↔ Faites défiler le tableau horizontalement
| Poste | Cloud | Local |
|---|---|---|
| Investissement initial | Aucun | Le matériel, amorti sur 3 à 5 ans |
| Coût à l'usage | Proportionnel au volume | Électricité seule, quelques dizaines d'euros/mois |
| Mise en service | Immédiate | Déploiement, à compter une fois |
| Maintenance | Incluse | À votre charge ou infogérée |
| Refroidissement du local | Sans objet | Marginal pour un poste, à prévoir pour un rack |
| Transfert de données | Frais de sortie possibles | Aucun |
| Valeur résiduelle | Nulle | Le matériel garde une valeur après amortissement |
| Risque de dérive | Tarif et volume peuvent évoluer | Coût connu à l'avance |
Deux postes penchent en faveur du cloud — pas d'investissement, pas de maintenance. Les six autres penchent vers le local dès que l'usage devient régulier. Le point d'équilibre dépend donc entièrement de votre volume.
Le seuil de bascule
Peu d'heures par mois → le cloud est plus économique. Usage continu ou partagé → le local devient nettement moins cher, car son coût cesse de croître avec l'usage.
Exemple : si vous avez besoin d'un GPU disponible en continu (~730 h/mois à 2 €/h, soit ~1 460 €/mois), un serveur à 18 k€ est remboursé en 12 à 14 mois, puis tourne encore des années. À l'inverse, pour 20 h ponctuelles par mois, restez sur le cloud — et nous vous le dirons si c'est votre cas.
Trois profils, trois calculs
Plutôt qu'une moyenne qui ne correspond à personne, voici trois situations représentatives avec les ordres de grandeur associés.
↔ Faites défiler le tableau horizontalement
| Profil | Usage type | Dépense cloud déplacée / an | Amortissement |
|---|---|---|---|
| Indépendant ou petite équipe | Un poste, usage quotidien, RAG léger | ~6 500 € | 14 à 15 mois |
| PME, 5 à 15 utilisateurs | Assistant partagé sur documents internes | ~28 000 € | ~9 mois |
| Équipe produit IA | Inférence en continu, tests, fine-tuning | ~66 000 € | ~7 mois |
Ces chiffres supposent un usage établi. Pendant la phase d'exploration — quand vous cherchez encore ce que l'IA peut vous apporter — le cloud reste le bon outil : il ne vous engage à rien.
Comment estimer votre volume réel
C'est l'étape que la plupart des entreprises sautent, et c'est celle qui détermine tout le calcul. Trois méthodes, de la plus simple à la plus fiable.
- Relever votre facture actuelle. Si vous utilisez déjà une API, la console de facturation donne votre consommation mensuelle. C'est la donnée la plus fiable qui soit — elle reflète votre usage réel, pas une projection.
- Compter les utilisateurs et les sollicitations. Nombre de personnes concernées × questions par jour × jours ouvrés. Une dizaine de questions quotidiennes par personne est un ordre de grandeur courant dès que l'outil est adopté.
- Mener un pilote mesuré. Quelques semaines d'usage réel sur un périmètre restreint, en relevant la consommation. C'est le plus long, et de loin le plus juste — parce que l'usage réel dépasse presque toujours l'estimation initiale.
Coût de l'IA : local vs cloud
Ajustez vos hypothèses — le calcul se met à jour en direct.
Envie du chiffre exact pour votre cas ?
Le simulateur donne un ordre de grandeur. Pour un chiffrage ferme, on part de votre usage réel, de vos modèles cibles et du nombre d'utilisateurs — puis on vous remet un calcul de rentabilité et un devis.
Faire chiffrer ma configuration →Au-delà du prix : ce que le local apporte
- La confidentialité — vos données et prompts ne sortent jamais.
- La prévisibilité budgétaire — un investissement connu, pas une facture variable.
- Le contrôle — modèle, version, personnalisation, pas de dépendance à un fournisseur.
Questions fréquentes
Quel est le coût minimum pour démarrer l'IA locale ?
Une workstation IA d'entrée démarre autour de 7 499 € HT avec une carte de 32 Go. Elle fait tourner un assistant de 14 milliards de paramètres — largement suffisant pour répondre sur vos documents — et sert six personnes en même temps.
C'est le ticket d'entrée réaliste pour une PME, pas une configuration de démonstration. En dessous, on descend sur du matériel grand public qui tiendra un usage individuel léger mais pas un service partagé.
Le matériel se déprécie-t-il vite ?
Moins qu'on ne le croit, et c'est un point que les comparatifs oublient. On amortit comptablement sur trois ans, mais un GPU professionnel reste opérationnel bien au-delà : les modèles ouverts progressent en qualité à taille égale, ce qui signifie qu'une machine achetée aujourd'hui fera tourner de meilleurs modèles dans deux ans, sans changer une pièce.
À l'inverse, un euro dépensé dans le cloud ne laisse rien. Après trois ans d'abonnement, vous n'avez aucun actif — le matériel, lui, garde une valeur résiduelle et peut être réaffecté.
Faut-il compter l'électricité et la climatisation ?
Oui, et c'est simple à chiffrer. Une machine sous charge consomme environ 1 kW ; à 0,20 €/kWh, un usage de 300 heures par mois représente une soixantaine d'euros. En fonctionnement continu, comptez environ 150 € mensuels.
La climatisation est marginale pour un poste dans un bureau. Elle devient un vrai sujet pour un serveur en rack, où il faut vérifier que le local évacue la chaleur — un point que nous validons avec vous avant la livraison, pas après.
Et si mon usage augmente ?
C'est précisément l'avantage structurel du local : le coût ne suit pas l'usage. Une fois la machine amortie, dix mille questions coûtent le même prix que mille. Dans le cloud, c'est l'inverse — chaque nouvel utilisateur adopte l'outil et alourdit la facture du mois suivant.
Si la croissance dépasse la capacité de la machine, on mutualise sur un serveur multi-GPU. Un point à anticiper dès la première commande : le châssis et l'alimentation se dimensionnent au départ pour permettre l'ajout de cartes.
Peut-on financer le matériel plutôt que l'acheter ?
C'est une question à poser à votre expert-comptable plutôt qu'à nous : le choix entre achat, crédit-bail ou location financière dépend de votre situation fiscale et de votre trésorerie, pas du matériel.
Ce que nous pouvons dire : nous établissons un devis ferme, avec un détail des composants, exploitable par votre partenaire financier. Nous ne proposons pas nous-mêmes de solution de financement.
Le calcul change-t-il si je n'utilise l'IA que quelques heures par semaine ?
Oui, complètement — et dans ce cas le cloud reste le bon choix. En dessous d'environ cent heures d'usage GPU mensuel, l'amortissement d'une machine dépasse la facture cloud correspondante. C'est de l'arithmétique, et nous n'allons pas prétendre le contraire.
La situation change si un autre critère entre en jeu : des données qui ne doivent pas sortir de l'entreprise rendent le local nécessaire quel que soit le volume. Le coût devient alors un critère secondaire.
Un projet serveur ou IA en tête ?
Décrivez votre usage — on vous répond avec un dimensionnement et un devis sous 48 h ouvrées. Sans engagement, et si le cloud est plus pertinent dans votre cas, on vous le dira.