Passer au playerPasser au contenu principal
Découvrez la station de travail locale à 15 000€ d'Infomax 👉 https://shop.numerama.com/amdinfomax

Cette tour est propulsée par le processeur AMD Ryzen Threadripper 9980X et deux cartes Gigabyte AMD Radeon AI Pro R9700. Grâce à la technologie AMD ROCm, cette machine fait tourner plusieurs IA en parallèle pour coder, designer et créer du contenu en totale autonomie, sans aucun cloud.

Qu’est-ce qu’on fait avec un PC “de bureau” à plus 15 000 € ? En partenariat avec AMD, on a testé une configuration hors norme (processeur Threadripper 9980X à 64 cœurs, double carte graphique Radeon AI Pro R9700 et 128 Go de RAM) entièrement dédiée à l'IA locale. Du brief de départ au design, en passant par le code, les tests et même la génération automatisée de Shorts, voici comment nous avons fait coder une application web complète par la machine elle-même. Tout reste en local sous le bureau : c'est 100 % privé, gratuit à l'usage et ça fonctionne même sans connexion Internet. Une véritable mini-entreprise logée dans une seule tour.

⏰ Sommaire
00:00 - Il y a quoi dans un PC à 15000 euros
01:45 - Pourquoi l'IA locale change tout ?
03:32 - Deux GPU, deux IA chacune
04:30 - Les logiciels : qui fait quoi dans l'atelier
06:46 - Coder une application de A à Z sans internet
08:14 - Et voilà notre app !
10:37 - Alors, c’est vraiment une entreprise ?



🤝 Pour toute demande de collaboration ► business@humanoid.fr
🔔 Abonnez-vous à notre chaîne ► https://youtube.com/c/numerama
🚩 Retrouvez toutes nos playlists ► https://www.youtube.com/c/numerama/playlists
---

Rejoignez-nous :
💻 Notre site ► http://www.numerama.com/
🐦 X ► https://x.com/numerama
📸 Instagram ► https://www.instagram.com/numerama
📱TikTok ► https://www.tiktok.com/@numerama
🔷 Facebook ► https://www.facebook.com/Numerama/
🎙️ Twitch ► https://www.twitch.tv/numerama

🟡 + rapide, + pratique, + exclusif : découvrir numerama+ ► https://www.numerama.com/numeramaplus/
---

Réalisation : Alfred Tertrais
Avec : Julien Cadot

---
#AMD #INFOMAX #RadeonAIPro
Transcription
00:00À quoi ça sert un PC à 15 000 euros ?
00:05Combien !
00:06Alors je peux vous répondre par une punchline, là-dedans vous avez pas un ordinateur mais vous avez une mini
00:10-entreprise.
00:11Ma petite entreprise !
00:13Et si vous trouvez que ça fait un peu trop post-LinkedIn, vous auriez pas tort, on va essayer de
00:18comprendre un peu mieux pourquoi c'est pas vraiment faux.
00:21Mais d'abord, petit point, config.
00:23Alors spoiler, ça ressemble pas à un rack de serveurs, ça a vraiment la gueule d'un vrai PC de
00:27bureau, bah plutôt classique hein.
00:28Comment on arrive à ce prix pour une tour, somme toute banale ?
00:31Eh bien on est parti d'une config chez Infomax et on l'a maxé.
00:34Le prix de base était à un peu plus de 7 000 euros et on a poussé toutes les jauges
00:38à fond.
00:39D'abord au cœur de la machine on trouve un très gros CPU d'AMD, c'est un Ryzen Thread
00:43Reaper 9980X à plus de 5 000 euros qui embarque 64 cœurs et 128 threads.
00:48Alors c'est un processeur pour station de travail doté d'un très grand nombre de cœurs qui excelle dans
00:52l'orchestration des charges de travail IA
00:54et donc dans l'optimisation de l'exécution des LLM locaux par la carte graphique.
00:58On a choisi cette gamme parce qu'elle permet de ne pas brider la puissance des composants.
01:02Alors la carte graphique, parlons-en parce qu'on en a mis deux.
01:04On a mis deux cartes graphiques AMD Radeon AI Pro R9700 avec 32 GO de mémoire chacune.
01:11Et chacune est propulsée par la technologie AMD ROC-M qui permet de faire de l'IA avec des GPU.
01:16Comme l'ordon l'indique, ce sont des cartes spécialisées dans le traitement algorithmique des IA.
01:20Alors attention, vous ne ferez jamais tourner League of Legends dessus, c'est pas fait pour ça.
01:25On est à 1800 euros par carte, donc ça fait vite monter la facture.
01:28Pour ne pas retarder le traitement de ces monstres, on a pris 128 GO de RAM ECC,
01:33donc c'est de la RAM pour serveur, la plus chère évidemment,
01:36et 2 Teraoctets de stockage NVMe, ce qui ajoute un autre billet de 1800 à la config.
01:40Bon avec tout ça, moi j'ai qu'une question, c'est est-ce que ça ne va pas cramer
01:42au bout de 5 heures de canicule ?
01:44C'est ce qu'on va voir.
01:45L'IA dans la tête des gens, et probablement dans la vôtre,
01:48c'est des énormes datacenters qui soutiennent des millions de GPU,
01:51et ces solutions clés en main qui sont proposées par OpenAI ou Anthropic sont extrêmement puissantes,
01:56mais elles ont un coût très élevé dès qu'on commence à faire des choses sérieuses dessus.
01:59Ou alors si vous êtes radins comme moi et que vous êtes sur un forfait à 20 euros, vous attendez
02:02des plombes.
02:02Du coup la bonne réflexion à avoir, c'est combien tu dépenses pour quels produits en sortie et à quelle
02:07vitesse.
02:07Ceux qui sont OK avec mon abonnement à 20 euros par mois resteront sur les plateformes qu'on a déjà
02:12citées.
02:12Mais dès qu'on dépasse des sommes en milliers d'euros mensuels, la rentabilité commence à être une vraie question.
02:17Ce qui est cool c'est qu'on peut en 2026 avoir plusieurs IA en local.
02:20Un modèle ultra léger qui exécute des tâches simples comme assigner des bugs à corriger,
02:24un modèle moyen qui code, un modèle lourd qui révise le code,
02:27un modèle spécialisé dans l'image qui s'occupe du design et de la direction artistique.
02:31Bref, chacun a besoin de plus ou moins de puissance à l'instant T,
02:34et l'orchestrateur va se charger de leur attribuer cette puissance.
02:37Et c'est pile ce qu'on va tester sur ce PC prêté par AMD, le partenaire de la vidéo.
02:41Donc je vous disais, là-dedans vous n'avez pas un ordinateur, vous avez une mini-entreprise,
02:45on a fait exactement la même chose que quand on parle avec Claude ou ChatGPT,
02:49tout reste sur cette seule machine, dans le bureau,
02:51ou plutôt sous le bureau de mon équipe commerciale qui n'était pas super contente.
02:54Le cerveau, c'est-à-dire les modèles d'IA, il vit sur les deux cartes graphiques AMD.
02:58Résultat, c'est gratuit à l'usage, c'est privé, et ça tourne même si vous coupez Internet.
03:02Ou si Trump continue de bloquer les meilleurs modèles d'Anthropic.
03:05Et pour vous montrer que c'est pas juste une démo de labo avec des benchmarks,
03:08on va construire un vrai produit avec, dont on a besoin.
03:11Une web app Numérama qui permet de lire les articles, de surfer sur le site,
03:14dont les résumés d'articles et les vidéos sont générés par l'IA en local.
03:18Tant qu'à faire, on va aussi ajouter un générateur de slideshow façon TikTok en automatique pour faire bien.
03:22Et en clair, on va utiliser l'IA local dans cet ordi à 15 000 balles à chaque étape,
03:26pour créer l'application et pour exécuter ce qu'elle va montrer.
03:29Allez, c'est parti !
03:30Ok, let's go !
03:32Première chose à comprendre, et c'est hyper important parce que ça prête souvent à confusion,
03:36cette tour qui est là, on l'a rendu accessible à distance.
03:39Alors là vous vous dites, ah bon, c'est du cloud déguisé.
03:41Bah non, c'est toute la subtilité.
03:43Comme on dit, le cloud c'est de l'informatique sur l'ordinateur de quelqu'un d'autre.
03:46Bah là c'est pareil, mais c'est notre ordinateur à nous.
03:48Cette tour, c'est juste un PC posé sous un bureau qui a une adresse sur le réseau.
03:52Concrètement, votre Mac ou votre laptop, c'est juste une télécommande qui va s'occuper de piloter ce PC.
03:57Tout le calcul, lui, reste à 100% sur la machine.
04:00Il n'y a rien qui est fait par des serveurs externes.
04:03Maintenant, la règle d'or de l'architecture, retenez-la parce qu'on va y revenir.
04:06On a deux cartes graphiques, comme vous l'avez vu, et on ne fait jamais tourner un seul modèle réparti
04:11sur les deux.
04:12Pourquoi ?
04:12Eh bien parce que les faire bosser à deux sur le même truc, ça les bloque.
04:16Ça part en deadlock, donc on fait l'inverse.
04:18Une carte, une tâche.
04:20La carte numéro 0, elle va s'occuper du texte par exemple.
04:23La carte numéro 1, elle va s'occuper de l'image.
04:25Et du coup, elles vont bosser en parallèle, chacune sur son boulot.
04:27Pendant que l'une dessine, l'autre écrit.
04:29En clair, on exploite les deux GPU en même temps, mais pas pour la même chose.
04:33Bon, et qui dit entreprise, pour reprendre la petite métaphore LinkedIn, dit rôle.
04:37Voilà l'équipe d'ingénieurs logiciels spécialisés qu'on a installé dans la machine.
04:41Et chacun a une tâche bien précise.
04:43On s'est focalisé sur des modèles ouverts et des logiciels open source.
04:47On a commencé par virer Windows et mettre Linux ou Ubuntu, qui est un socle à tous les autres.
04:50Et les principaux modèles sont chinois, sous licence Apache.
04:54Coquille, XTTS, c'est allemand.
04:56Et tous les logiciels orchestrateurs sont américains, sous licence MIT ou GPL3.
05:00Sauf FMPEG, qui est une fierté française.
05:03Faut que vous sachiez que tout est gratuit, au moins en version de base.
05:06Et de toute façon, on n'avait plus un centime quand on a sorti les 15 274 euros du PC.
05:10Le premier, c'est Olama.
05:12C'est le moteur qui fait tourner les LLM, c'est-à-dire les modèles de langage.
05:16C'est lui qui va héberger le cerveau.
05:18Dessus, on a chargé trois modèles.
05:19Un gros modèle de raisonnement, Quen332B, qui sert au résumé, au brief, à l'écriture des scripts.
05:24Un modèle spécialisé code, Quen3Coder30B, qui est le modèle de notre agent développeur.
05:29Et un petit modèle léger, Quen2.5Coder, juste pour l'autocomplétion.
05:32Le deuxième, c'est ComfyUI.
05:35Lui, c'est le studio graphique.
05:36Il fait tourner un modèle de génération d'images, QuenImage, sur la deuxième carte.
05:40Il faut compter à peu près 6 secondes pour sortir une image.
05:43C'est top.
05:44Le troisième, c'est Coquille XTT-SV2.
05:47C'est la voix, une voix neuronale française naturelle.
05:49Le 17 juin, la fusée européenne tentera un record.
05:53Elle utilise de nouveaux propulseurs plus puissants.
05:55Et petite astuce maligne, celle-là, on la fait tourner sur le processeur et pas sur les cartes graphiques.
05:59Pourquoi ?
06:00Eh bien parce que le Threadripper a 128 threads, comme on l'a dit.
06:03Il a de la marge et ça permet de laisser les deux cartes libres pour le texte et l'image.
06:06Bref, on ne crée pas d'embouteillage.
06:07Le quatrième, c'est OpenCode et celui-là, il est central.
06:11C'est un agent de code, l'équivalent open source de CloudCode.
06:14Et en gros, c'est lui l'orchestrateur qui parle aux autres agents.
06:16Il planifie l'architecture, il lit le code, il l'écrit, il lance des commandes tout seul.
06:20Et il est branché sur le LLM local.
06:22Donc votre dev, il tourne localement sans avoir à payer un service d'IA dans le cloud.
06:25Puis enfin, on a quelques utilitaires qui font le liant.
06:27FFmpeg, on vous en a parlé, pour le montage vidéo.
06:30Docker, pour faire tourner proprement les conteneurs sans abîmer le système, de façon bien reproductible.
06:35Évidemment, AMD RockM, qui est le logiciel d'AMD qui permet aux modèles de parler aux cartes graphiques,
06:40sinon elles ne comprendraient rien à leur langage.
06:41Et l'app elle-même, qui tourne sur un serveur Node sans aucune dépendance, ce qui la rend hyper légère.
06:46Pour cette démo, on a fait coder l'app par la machine elle-même, évidemment.
06:50Et comme on a un petit peu l'habitude, on a reproduit la même chaîne qu'on utiliserait pour sortir
06:54un vrai produit.
06:55Du brief jusqu'au déploiement, sans jamais sortir de la tour.
06:59Alors première étape, le brief.
07:00On ouvre une interface de chat et on parle au gros modèle QN332B en mode plan.
07:05C'est un mode fondamental qu'on trouve dans tous les logiciels de code par IA,
07:08parce qu'il planifie le projet sans l'exécuter.
07:11Il vous pose des questions jusqu'à ce que tout soit carré,
07:13il sait trouver les bonnes technos, les bons plugins, les bonnes étapes d'intégration.
07:16En clair, c'est le chef de projet.
07:18Étape 2, le design.
07:20Pendant qu'on réfléchit, la deuxième carte graphique tourne avec ComfyUI et génère les visuels.
07:24Et notez bien, ça se passe en parallèle du reste.
07:27Il y a une carte graphique qui design, une carte qui code, le tout en même temps.
07:30Étape 3 d'ailleurs, le code.
07:32Alors là, on propulse OpenCode avec le modèle QN3Coder et c'est lui qui écrit l'app.
07:36Un serveur node sans dépendance, une interface en javascript pure avec un design qui ressemble à du iOS récent.
07:41L'agent écrit le code en direct, sous vos yeux.
07:44Étape 4, évidemment, les tests.
07:45Alors on va lancer une suite de 17 tests automatiques avec Playwright,
07:49c'est un petit outil open source développé par Microsoft.
07:51Il va vérifier les points d'entrée du serveur et l'interface de l'app et il va confirmer qu
07:55'il n'y a aucune erreur dans la console.
07:56Après 17 tests, le score c'est 17 sur 17, 0 erreur, bien joué.
08:01Enfin, on passe au déploiement.
08:03On emballe tout dans un conteneur Docker, un outil qui permet d'héberger le logiciel avec tout ce dont il
08:07a besoin pour tourner,
08:08dans une sorte de boîte étanche.
08:09On va créer un accès à cette boîte via Cloudflare.
08:11A partir de là, on peut tester et faire tester notre app à des humains.
08:14Voilà, brief, design, code, test, déploiement, la boucle complète d'une boîte de dev faite par une seule machine, sous
08:21un seul bureau.
08:22Et voilà notre app.
08:28Qu'est-ce qu'on a dessus ?
08:30Alors déjà, on a l'essentiel, évidemment, c'est une app de lecture de nos articles qui est hyper clean.
08:34Belle typo, des images bien mises en valeur et une bonne réactivité, c'était hyper important.
08:38Ce qui est intéressant, c'est que par rapport au site, on a aussi des features exclusives.
08:41Donc on a deux recherches, qui n'est pas sur Numérama encore.
08:44On a un onglet short qui convertit les articles en petites vidéos.
08:47Un onglet vidéo qui reprend toutes nos productions sur YouTube.
08:50Et surtout, un résumé par IA en temps réel.
08:52Je vous explique comment il marche juste après.
08:54Le petit bonus qu'on a ajouté, c'est l'agrégateur de sujets.
08:56L'app va aller beaucoup plus loin que le site de Numérama en réunissant les sujets les uns par rapport
09:00aux autres pour créer des catégories intelligentes.
09:02Ça permet pour vous, les lecteurs, d'aller plus loin quand on veut creuser un sujet.
09:06Et cette app, elle a été faite en 6 heures de taf par la machine que j'ai sous mes
09:09yeux.
09:09Une fois notre app construite, l'IA locale est encore utilisée parce qu'elle est branchée partout.
09:13L'idée, c'est de vous montrer que ce n'est pas qu'un usage one shot pour terminer un
09:16projet, mais un outil qu'on peut utiliser en permanence.
09:18Je vous montre les trois endroits clés où on sollicite la bête en permanence.
09:21Premier endroit, évidemment, c'est le résumé d'article.
09:24Vous ouvrez un article et le modèle QN332B lit le texte complet et vous écrit son résumé.
09:29Le résumé va s'écrire en direct, mot par mot, sous vos yeux, en streaming.
09:32C'est exactement la sensation que vous avez quand vous utilisez ChatGPT, sauf que là, tout est calculé dans 7
09:37tours et avec un taux d'erreur quasi nul parce que ce modèle a un contexte énorme.
09:41C'est-à-dire qu'il va prendre tout l'article et le résumer en restant strictement dans le cadre
09:44de l'article et de ses consignes.
09:46Deuxième endroit où on continue à utiliser la tour, c'est le regroupement par sujet.
09:49L'app va ranger les articles qui parlent de la même chose ensemble.
09:51Pour ça, elle utilise ce qu'on appelle des embeddings, une façon de mesurer à quel point deux textes parlent
09:55du même truc.
09:56Là encore, c'est calculé en local et ça s'affiche dans l'app.
09:59Et le troisième, c'est vraiment le gros morceau, le générateur de short.
10:02A chaque nouvel article publié, la machine fabrique un slideshow vertical façon TikTok ou Riffs de manière complètement automatique.
10:08Et c'est là que les 4 IA bossent ensemble.
10:10Parce que le modèle Q1-3, il écrit un script viral avec un hook, des scènes, etc.
10:14La voix X-TTS V2, elle va le lire en français naturel.
10:17ConfiEye, il va générer 4 à 6 images cinématiques pour illustrer.
10:20Et FFmpeg monte tout ça en vertical en 1080x1920 avec le petit effet de zoom Ken Burns qui va bien.
10:25Le tout est orchestré pour que les deux cartes et le processeur travaillent en même temps, chacun sur sa partie.
10:30On va pas se mentir, c'est la partie la plus impressionnante, mais c'est aussi la moins développée.
10:34Parce que les IA galèrent sur le montage et l'assemblage vidéo.
10:36Il faut bien qu'on continue à servir à quelque chose.
10:39Alors non, on ne vous a pas menti.
10:40Dans cette tour, vous avez un cerveau qui réfléchit et qui rédige.
10:43Un petit studio graphique qui dessine.
10:44Une voix off qui parle.
10:45Un développeur qui code et qui teste.
10:47Et une chaîne de montage qui sort des vidéos.
10:49Un brief du design, du code, des tests, du déploiement, de la production de contenu, bref, tout ce que vous
10:53délégueriez normalement à des prestataires ou à des services cloud que vous payez tous les mois et qui vous mettent
10:57ce genre de message si vous ne payez pas assez.
11:00Est-ce qu'on avait vraiment besoin d'une configuration aussi coûteuse ?
11:03Alors ça dépend.
11:04Ce qui compte, c'est surtout l'architecture et ce que chaque composant débloque.
11:08Côté processeur, les Threadripper 9970X ou 9960X sont déjà une excellente base et on aurait pu carrément faire notre projet
11:15avec ces processeurs.
11:16Alors j'en conviens, l'IA local fait encore un peu peur mais une fois que la configuration initiale est
11:20passée, on comprend le potentiel de tous ces outils.
11:22Et si vous vous demandez combien de tokens par seconde sort cette tour, ce sera ma conclusion.
11:26La réponse est là.
11:50Sous-titrage Société Radio-Canada
Commentaires

Recommandations