31 août 2026
En juillet 2026, un LLM de 28,9 millions de paramètres a fonctionné entièrement sur appareil sur un ESP32-S3 à 8 $ à près de 10 tokens par seconde. Voici comment l'astuce fonctionne, qui l'a construit

Exécuter un grand modèle de langage sur un microcontrôleur repose sur la réduction du modèle sans détruire ses capacités linguistiques. L'approche la plus courante est la quantification post-entraînement, où les poids en virgule flottante sont mappés vers des entiers de bits inférieur, comme des valeurs 8 bits ou même 4 bits. Cela réduit l'empreinte mémoire et permet une arithmétique exclusivement en entiers, que l'ESP32‑S3 peut exécuter efficacement. L'élagage des poids supprime les connexions qui contribuent peu à la sortie, réduisant encore la taille. La distillation des connaissances crée un réseau étudiant plus petit qui imite le comportement d'un réseau enseignant plus grand, atteignant souvent des performances comparables avec une fraction des paramètres. Ces techniques réunies peuvent ramener un modèle de dizaines de millions de paramètres à quelques mégaoctets, une taille qui tient dans la RAM limitée d'une carte peu coûteuse.
L'ESP32‑S3 offre environ un demi-mégaoctet de SRAM et plusieurs mégaoctets de flash, avec une fréquence d'horloge d'environ 240 MHz et une unité de traitement vectoriel qui prend en charge les instructions SIMD. Comme l'appareil ne dispose pas d'unité de virgule flottante, les développeurs doivent s'appuyer sur l'arithmétique en virgule fixe ou des bibliothèques spécialisées qui génèrent des noyaux en entiers. Des pools mémoire adaptés à la mémoire et un placement soigné des tenseurs intermédiaires préviennent les plantages par manque de mémoire. Les options du compilateur qui activent un déroulement et une vectorisation agressifs des boucles, combinés à des mouvements de données pilotés par DMA, maintiennent le CPU occupé tout en minimisant les stalls. En pratique, ces optimisations permettent au moteur d'inférence de traiter rapidement un token, offrant un débit modeste suffisant pour des applications interactives aux exigences de latence modestes.
Quantifiez les poids en 8 bits ou moins pour réduire la mémoire et permettre un calcul en entiers.
Élaguer les connexions à faible impact pour réduire la taille du modèle.
Utilisez des bibliothèques compatibles SIMD comme CMSIS‑NN ou TinyML.
Allouez soigneusement les tampons en RAM pour éviter la fragmentation.
Exploitez le stockage flash pour les poids du modèle et streamez les données depuis une flash externe si nécessaire.
Déployer un LLM sur un microcontrôleur étend la portée de l'IA à des appareils qui ne peuvent pas dépendre d'une connectivité cloud, préservant la vie privée et éliminant la latence réseau. Cela ouvre aussi la voie à des applications basse consommation, comme les assistants vocaux, la complétion de code sur appareil, ou la traduction en temps réel dans des environnements isolés. Cependant, le compromis est une taille de vocabulaire contrainte, une longueur de contexte limitée, et la nécessité d'accepter une perplexité inférieure à celle des modèles de classe serveur. L'entraînement reste impraticable sur un tel matériel, l'écosystème dépend donc de modèles pré-entraînés qui ont été fortement compressés. Lorsque l'objectif est de fournir une expérience utile et réactive dans des budgets stricts de puissance et de coût, la combinaison d'une compression agressive et d'un codage conscient du matériel s'avère efficace.
À mesure que l'edge AI continue de mûrir, la capacité d'exécuter des modèles de langage sur des microcontrôleurs peu coûteux illustre un glissement vers une intelligence décentralisée. Les ingénieurs utilisent de plus en plus des approches hybrides qui combinent de petits modèles avec des services backés par le cloud, permettant aux appareils de décharger les calculs lourds si nécessaire tout en offrant localement des réponses rapides et privées. Cet équilibre entre efficacité sur appareil et assistance cloud optionnelle est susceptible de façonner la prochaine génération d'applications IoT, rendant une compréhension sophistiquée du langage accessible au-delà des serveurs traditionnels.
Un parcours du WAP, Symbian et Windows Mobile vers Android, le SaaS et l'IA — et les leçons que j'en ai tirées.
31 août 2026