Vue d'ensemble

Qu'est-ce qu'Atome LM ?

Un modèle de langage que l'on compile dans le firmware, pas que l'on appelle par le réseau.

Atome LM est un modèle de langage assez petit pour être compilé dans le firmware d'un microcontrôleur. Pas un modèle qu'on appelle via une API. Pas un modèle qu'on rétrécit pour un téléphone. Un modèle qui tient dans la même image flash que le reste du firmware, sur un composant à deux dollars, sans système d'exploitation, sans pile réseau et sans allocateur mémoire.

Le checkpoint de 944 000 paramètres pèse 271 Ko de poids et le moteur qui l'exécute 2,6 Ko de C99 compilé. Sur un ESP32-WROOM-32 physique, il génère du texte cohérent à environ 1,0 jeton par seconde, entièrement hors ligne, avec pour tout matériel la puce et un câble USB.

Le problème qu'il résout vraiment

Sur un microcontrôleur, la contrainte intéressante n'est presque jamais « sait-il penser ». C'est « est-ce que ça rentre, et puis-je prouver ce que ça fera ». Trois conséquences, et c'est tout le design :

Ce que ce n'est pas

Les deux lignes de produit

Atome LM (le modèle de langage)Atome LM EDGE (le moteur de capteurs)
Ce qu'il faitGénère et classe du texte sur l'appareilClasse des fenêtres de capteurs sur l'appareil
Taille typique60 000 – 944 000 paramètres~6 567 paramètres
Empreinte20 Ko – 271 Ko de poids15 444 o de flash au total
Vérifié contreCortex-M3 sous QEMU, et un ESP32-WROOM-32 physique2 947 fenêtres de test via le vrai moteur C
Public ?Oui — Apache-2,0Engagement pilote

La comparaison avec TensorFlow Lite for Microcontrollers concerne la ligne EDGE. Les chiffres de perplexité concernent le modèle de langage. Les mélanger, c'est citer une empreinte de l'un et une précision de l'autre.

Comment il est construit

Chaque bloc exécute en parallèle trois opérations structurellement différentes — une convolution causale profonde à 5 prises, un modèle d'état diagonal et une attention parcimonieuse top-k=4 — et un routeur softmax par jeton décide de la part de chacune pour le caractère courant. Trois petits spécialistes coûtent moins de mémoire qu'un gros généraliste à qualité égale. Toutes les projections sont ternaires, échelle par tenseur. La page architecture détaille tout cela.