Les questions que l'on nous pose vraiment, avec les chiffres qui y répondent. Quand la réponse est « non » ou « non mesuré », c'est écrit ainsi.
Questions
Un modèle de langage peut-il vraiment tourner sur un microcontrôleur ?
Oui, s'il a été conçu pour. Le checkpoint de production d'Atome LM fait 944 000 paramètres, 271 Ko de poids ternaires et un moteur C99 de 2,6 Ko, et il génère du texte cohérent sur un ESP32-WROOM-32 physique à environ 1,0 jeton par seconde, hors ligne. Ce qui ne marche pas, c'est de rétrécir un grand modèle.
Quelle taille fait Atome LM ?
Six tailles sont livrées, du modèle nano à 14,5 Ko de RAM au modèle de production 944K à 411 Ko. Le moteur de capteurs, Atome LM EDGE, tient dans 15 444 octets de flash au total pour un réseau de 6 567 paramètres.
Est-il plus rapide que TensorFlow Lite for Microcontrollers ?
Par décision sur une fenêtre glissante, 27,3× moins cher que CMSIS-NN, la bibliothèque que X-CUBE-AI génère. Par fenêtre ponctuelle, 2,89× plus lent. La comparaison complète, y compris l'axe que nous perdons, est sur /fr/benchmarks/atome-lm-vs-tflite-micro/.
Est-il plus précis que TensorFlow Lite for Microcontrollers ?
Non — c'est une égalité. 0,9095 ± 0,0077 contre 0,9097 ± 0,0154 sur UCI HAR, découpe par sujet sans fuite, 5 graines.
De combien est-il plus petit ?
4,64× sur la flash totale et 2,17× sur la RAM d'exécution face à TFLite Micro, pour le même réseau. La variante ternaire descend à 4 765 octets de poids.
A-t-il besoin d'une connexion Internet ?
Non, et il ne peut pas s'en servir. Le moteur ne contient ni allocateur, ni sockets, ni descripteurs de fichiers. L'absence de sortie réseau est une propriété du binaire compilé, vérifiable dans la table des symboles.
Faut-il de la PSRAM ?
Pas pour les petits modèles. Le modèle 944K tourne sur un WROOM-32 sans PSRAM en réduisant la fenêtre de contexte à 24 jetons, ce qui place l'état de travail autour de 159 Ko.
Combien coûte une inférence ?
Rien à l'unité : il n'y a pas d'appel d'API. Le coût, c'est le composant, et ceux du tableau de compatibilité vont d'environ 2 $ à environ 30 $.
Est-ce open source ?
L'architecture, le moteur C99, le format d'export et un checkpoint TinyStories de 944K paramètres sont sous Apache-2,0 sur GitHub, avec les poids sur Hugging Face et un DOI Zenodo. Les variantes de recherche élaborées et le banc de test EDGE ne sont pas publics.
Puis-je l'affiner sur mes propres données ?
Oui, et c'est le mode prévu. Entraîné sur un domaine, il est fluide dans ce domaine ; entraîné large à cette taille, il est incohérent. La ligne v2 ajoute un chemin d'entraînement à partir de vos propres CSV.
A-t-il été mesuré sur du vrai matériel ?
Sur une seule carte, un ESP32-WROOM-32 physique. Tout le reste du tableau matériel est une compilation croisée exécutée sous QEMU. L'énergie n'a jamais été mesurée sur aucune carte.
En quoi est-il mauvais ?
La conversation généraliste, tout ce qui dépasse le million de paramètres où un transformeur flottant ordinaire gagne d'environ 11 %, la latence ponctuelle face à CMSIS-NN, et toute affirmation sur l'énergie. Tout cela est sur la page des limites.