AMD rachète une start-up qui grave l’IA dans le silicium

iEXExchanger
AMD rachète une start-up qui grave l’IA dans le silicium

AMD a conclu un accord pour racheter la start-up canadienne Taalas, dont les puces gravent les poids d’un modèle directement dans le silicium plutôt que de les lire en mémoire. Le montant n’a pas été communiqué.

AMD a signé un accord pour racheter Taalas, une start-up de Toronto dont les ingénieurs gravent littéralement les poids d’un réseau de neurones dans une puce de silicium. L’annonce date du 6 août ; aucune des deux parties n’a dévoilé le montant, évoquant seulement des « conditions de clôture habituelles » et l’attente des autorisations réglementaires.

Un GPU classique consacre chaque cycle d’inférence à faire transiter des milliards de paramètres de la mémoire vers ses unités de calcul, et ce trajet constitue le vrai goulot d’étranglement pour les grands modèles de langage. Taalas s’en affranchit entièrement : les poids ne sont plus stockés à part, ils sont gravés dans les transistors eux-mêmes. Sa puce de démonstration, la HC1, est une puce de 815 millimètres carrés dotée de 53 milliards de transistors, gravée en 6 nanomètres chez TSMC. Selon ses propres tests, elle atteint jusqu’à 17 000 tokens par seconde et par utilisateur avec Llama 3.1 8B, devançant dans cet essai les H200 et B200 de Nvidia, ainsi que des puces de Groq, SambaNova et Cerebras.

La contrepartie, c’est la flexibilité. Un rack conçu pour un modèle ne peut pas être redirigé vers un autre : la puce est, de fait, le modèle. Taalas affirme que la mise à jour des poids ne nécessite que le changement de deux couches de masque photolithographique plutôt qu’une refonte complète, ce qui réduit le coût des itérations — mais chaque changement exige tout de même un nouveau cycle de fabrication. Ce calcul économique ne tient que pour des modèles utilisés à très grande échelle et de façon stable, pas pour ceux qui changent tous les deux mois.

AMD présente ce rachat comme un moyen de compléter son offre d’inférence. « Nous construisons une plateforme d’IA complète qui laisse aux clients la liberté de déployer le bon calcul pour chaque charge de travail », a déclaré Vamsi Boppana, vice-président senior du groupe IA d’AMD. L’entreprise prévoit d’intégrer la technologie de Taalas dans sa feuille de route pour les accélérateurs, aux côtés des GPU Instinct, des processeurs EPYC, de la plateforme de racks Helios et du logiciel ROCm — la même combinaison avec laquelle AMD a défié Nvidia en juillet. Ljubisa Bajic, cofondateur et PDG de Taalas — fondée à Toronto en 2023 —, a présenté l’accord comme un moyen d’accélérer le développement tout en gardant les racines canadiennes de l’équipe.

Pour l’instant, il s’agit d’une puce de démonstration et non d’un produit commercialisé, et le prix restera confidentiel. Mais miser sur du silicium propre à un seul modèle va à contre-courant du rythme même du marché, où de nouvelles versions de LLM sortent toutes les quelques semaines : AMD parie que l’inférence dédiée et bon marché a du sens précisément là où les modèles ont cessé de changer aussi vite.

Questions et réponses

Questions fréquemment posées sur le sujet de l'article

Qu’a exactement racheté AMD ?

AMD a signé un accord pour racheter Taalas, une start-up de Toronto qui fabrique des puces gravant les poids d’un réseau de neurones directement dans le silicium. L’accord a été annoncé le 6 août 2026 ; aucune des deux parties n’a dévoilé le montant.

En quoi les puces de Taalas diffèrent-elles d’un GPU classique ?

Un GPU classique charge les paramètres du modèle depuis la mémoire à chaque étape d’inférence, ce qui crée un délai. Les puces de Taalas stockent les poids directement dans les transistors et s’affranchissent de cette étape : sa puce de démonstration HC1 atteindrait jusqu’à 17 000 tokens par seconde et par utilisateur avec Llama 3.1 8B.

Quel est le principal inconvénient de cette approche ?

Une puce conçue pour un modèle ne peut pas être rapidement redirigée vers un autre : changer les poids exige un nouveau cycle de fabrication. L’approche n’est donc rentable que pour des modèles utilisés à grande échelle et de façon stable.

Pourquoi cet accord compte-t-il face à la rivalité avec Nvidia ?

AMD complète son offre d’inférence IA en ajoutant la technologie de Taalas à ses GPU Instinct, ses processeurs EPYC et sa plateforme Helios — la même combinaison utilisée pour défier Nvidia en juillet 2026.