DeepSeek : le moteur réinventé
💡 En bref : pour rendre une IA plus puissante, les géants américains achètent toujours plus de puces et construisent des centres de calcul géants. DeepSeek, un laboratoire chinois, n'a ni les meilleures puces ni les mêmes milliards. Alors il a fait autrement : il a revu le moteur. Résultat : son dernier modèle se hisse au niveau des meilleurs, pour un prix 30 à 80 fois plus bas selon l'heure. C'est l'IA qui fait réfléchir Emile.
💪 Deux façons de rendre une IA plus forte
La première, c'est la force. On achète plus de cartes de calcul, on construit des centres de données toujours plus gros, on paie des factures d'électricité qui donnent le tournis. Certains parlent même de centrales nucléaires dédiées. C'est la course que mènent les grands laboratoires américains depuis trois ans.
La deuxième, c'est l'astuce. C'est celle de DeepSeek. À cause des sanctions américaines, pas d'accès aux meilleures puces. Un budget qui n'est qu'une fraction de celui des géants. Et pourtant, un modèle au niveau des meilleurs.
Ce n'est pas un modèle un peu meilleur. C'est un moteur qui consomme beaucoup moins.
📝 Comment une IA lit votre texte : les notes
Pour comprendre leurs idées, il faut d'abord comprendre le problème.
Quand vous envoyez un texte à une IA, il se passe deux choses :
- 📖 Elle lit. Votre question, vos documents, tout ce que vous lui donnez. Et à chaque étage de son réseau, elle prend des notes.
- ✍️ Elle écrit. Sa réponse, morceau de mot par morceau de mot. Et pour choisir chaque morceau, elle relit ses notes.
Ces notes sont rangées dans une sorte de coffre. Les spécialistes l'appellent le « cache KV ». Le coffre lui évite de tout relire depuis le début à chaque mot.
🧳 Le problème : le coffre déborde
Sur une question courte, aucun souci. Les notes tiennent dans la mémoire ultra-rapide de la carte de calcul, juste à côté du processeur.
Mais aujourd'hui, on ne pose plus de petites questions. On veut des agents qui travaillent pendant des heures, à qui on donne des centaines de pages, des conversations de dizaines d'échanges. Les notes explosent.
Le coffre déborde de la mémoire rapide. Il faut ranger le surplus plus loin, dans une mémoire plus lente. Et à chaque fois que l'IA a besoin d'une note rangée loin, elle attend. Elle ne calcule plus, elle attend que l'information revienne.
C'est le mur auquel se heurte toute l'industrie. Et c'est une des raisons pour lesquelles le prix des cartes de calcul haut de gamme a explosé.
✂️ Première idée : couper le modèle en deux
Une IA est faite d'étages, qu'on appelle des couches. Dans un modèle classique de 40 couches, chaque couche relit tout votre texte. 40 lectures complètes.
DeepSeek s'est posé une question simple : pourquoi toutes les couches devraient-elles lire ?
Alors ils ont coupé le modèle en deux :
- 📖 les 20 premières couches lisent votre texte et prennent les notes ;
- ✍️ les 20 dernières ne lisent rien. Elles reprennent les notes de la première moitié, et se concentrent sur les derniers mots qu'elles sont en train d'écrire, pour garder le fil.
Sur le papier, ça devrait donner une IA plus bête. En pratique, non. Et la lecture coûte deux fois moins cher. Pas en achetant des puces plus rapides : en arrêtant de faire lire 40 couches quand 20 suffisent.
📒 Deuxième idée : quatre carnets au lieu de quarante
Même lues à moitié, les notes restent énormes. Alors DeepSeek va plus loin.
Sur les 40 couches, seules 4 ont le droit de créer leurs propres notes. Les 36 autres se débrouillent avec celles qui existent déjà. Elles travaillent, en quelque sorte, à crédit.
On passe de 40 carnets de notes à 4. Et ça change tout : un modèle qui avait besoin d'un serveur entier, dans un de ces centres de calcul qu'on voit pousser partout, commence à tenir dans du matériel qu'un particulier ou une petite entreprise peut se payer.
🧽 Troisième idée : effacer la petite mémoire
C'est la décision la plus surprenante.
Pour garder le fil, le modèle garde en tête les 128 derniers morceaux de mots qu'il vient d'écrire. C'est sa mémoire à court terme, comme la nôtre : on retient une information le temps d'en avoir besoin, et on l'oublie l'heure d'après.
Jusqu'ici, à chaque échange d'une conversation, cette petite mémoire était sauvegardée sur un disque, pour ne pas perdre le fil. À force, les disques saturaient.
La solution de DeepSeek : tout effacer. Quand le modèle a fini sa réponse, sa petite mémoire disparaît. Au tour suivant, il recalcule ces 128 morceaux depuis zéro. Pour une carte de calcul moderne, c'est l'affaire de quelques microsecondes. Aller les rechercher sur un disque prenait bien plus longtemps.
Tout le monde gardait cette mémoire, parce que c'était l'évidence : on a des données, on les garde. DeepSeek a posé la question que personne ne posait : et si les garder coûtait plus cher que les recalculer ? La réponse était oui. La bonne décision était celle qui paraissait folle.
🏆 Le résultat : au niveau des meilleurs
Le modèle s'appelle DeepSeek V4.1 Flash. Il est sorti le 10 septembre 2026. D'après la vidéo dont je m'inspire ici :
| 🐋 DeepSeek V4.1 Flash | 🇺🇸 Les meilleurs modèles américains | |
|---|---|---|
| 🧪 Test de programmation le plus suivi | 74,2 % | Le même score |
| 💼 Classement sur des tâches de travail réelles | Numéro 1 | Derrière |
| ⚡ Vitesse | 208 morceaux de mots par seconde, près de 3 fois la moyenne | Plus lents |
| 💶 Prix pour lire un million de morceaux de mots | 0,15 $ | 10 $ |
| 💶 Prix pour en écrire un million | 0,60 $ | 50 $ |
Le prix double aux heures de pointe. Selon l'heure, DeepSeek est donc 30 à 80 fois moins cher, pour des performances équivalentes sur la plupart des tests.
Et le modèle est libre : ses réglages sont publiés, sous une licence qui permet à n'importe qui de le télécharger et de construire par-dessus. En quelques heures, la communauté en avait déjà publié des versions modifiées.
DeepSeek était si sûr de lui qu'il a annoncé retirer son modèle haut de gamme, battu par ce modèle conçu pour l'économie. Une version encore plus puissante est en préparation.
🌍 Ce que ça change
Pendant trois ans, la règle était simple : celui qui a le plus de puces gagne. DeepSeek vient de montrer que c'est faux. La façon dont on organise le calcul peut compenser un énorme manque de puissance.
C'est exactement ce qui s'est passé avec l'électricité. Aujourd'hui, on paie l'intelligence au morceau de mot, comme on paie l'énergie au kilowattheure. Et la seule question qui compte devient : qui arrive à faire baisser ce prix le plus vite ?
Le message de la vidéo à la France est clair : nous avons les puces, des chercheurs brillants, des écoles d'ingénieurs parmi les meilleures du monde, des financements. Ce n'est pas une question de moyens. C'est une question de volonté.
🧑🔧 Et Emile ?
Emile est un agent IA. L'IA qui le fait réfléchir, c'est DeepSeek.
Ce que vous venez de lire explique trois choses :
- ⏳ Emile travaille longtemps, sur beaucoup de documents. C'est exactement le cas où le moteur de DeepSeek fait la différence.
- 💶 Un moteur qui consomme moins, c'est un abonnement abordable. C'est une des raisons pour lesquelles Emile coûte le prix d'un café par jour.
- 🇫🇷 Un modèle libre peut tourner ailleurs qu'en Chine. C'est ce qui rend possible Emile Confidentiel : une IA DeepSeek, hébergée en France.
❓ Les questions qu'on me pose le plus
DeepSeek, c'est chinois : mes données partent en Chine ?
Avec la formule Emile, l'IA tourne chez DeepSeek, en Chine. Avec Emile Confidentiel, une IA DeepSeek tourne en France, et vos données ne quittent pas le pays. Vous choisissez.
Pourquoi le prix change selon l'heure ?
Comme l'électricité : aux heures de pointe, tout le monde utilise l'IA en même temps, et le prix double. La nuit, quand Emile travaille pendant que vous dormez, c'est moins cher.
D'où vient cet article ?
D'une vidéo de vulgarisation que j'ai trouvée très claire. Je l'ai résumée ici simplement. Les chiffres sont ceux de la vidéo. 👉 La vidéo sur YouTube
👉 Comment fonctionne une IA ? · 🇫🇷 Emile Confidentiel · 🧩 Le mystère à l'intérieur d'une IA
Alexandre Sintes, spécialiste de l'IA, fondateur de Préceptio
Vous voulez aller plus loin ? Sophie vous forme à créer avec Emile. La formation se fait sur devis.
Demander un devis