Edge0 publie un framework open source conçu pour exécuter localement de grands modèles de langage sur des appareils Apple grand public, dont un modèle mélange d’experts de 35 milliards de paramètres sur iPhone. Le projet affirme limiter le pic de mémoire à environ 1 à 2,5 Go en chargeant depuis le stockage uniquement les experts nécessaires à chaque étape de génération.
L’objectif est de déplacer une partie de l’inférence du cloud vers les téléphones, ordinateurs portables et cartes compactes. Le traitement local évite l’envoi systématique des données vers un serveur et supprime la facturation à l’usage, mais les performances dépendent fortement de la vitesse du stockage et de l’architecture du modèle.
Les poids des experts restent sur le stockage
Un modèle mélange d’experts n’utilise qu’une fraction de ses paramètres pour calculer chaque jeton. Edge0 exploite cette propriété pour conserver la majorité des poids sur le SSD ou la mémoire flash, puis charger à la demande les blocs sélectionnés. Cette méthode réduit l’occupation de la mémoire vive, au prix d’échanges fréquents avec le stockage.
Selon le dépôt officiel, le framework combine ce déchargement avec un prérouteur chargé d’anticiper les experts qui seront sollicités. Les lectures peuvent ainsi commencer avant que la couche concernée en ait besoin. Un cache conserve aussi les blocs réutilisés afin de limiter les transferts.
Le projet propose deux paliers : Edge0-35B-A3B et Edge0-8B-A1B. Les lettres A3B et A1B indiquent approximativement le nombre de paramètres actifs par jeton. Les poids de démonstration et les adaptateurs entraînés sont distribués via Hugging Face, tandis que le code est annoncé sous licence Apache 2.0.
Une compression accompagnée d’adaptateurs
Edge0 ne se contente pas de quantifier les poids en quatre bits. Son mécanisme Recover-LoRA ajoute des adaptateurs légers entraînés pour compenser une partie de la dégradation induite par la compression. L’équipe cherche ainsi à réduire la taille en mémoire tout en conservant un niveau de réponse exploitable.
La démonstration publiée par Samuel Zeng montre un modèle de 35 milliards de paramètres fonctionnant sur un iPhone avec un pic mémoire annoncé entre 1 et 2,5 Go. Le site du projet présente de son côté le modèle Edge0-35B à 1,06 Go et fixe à 3 Go la cible maximale pour les appareils pris en charge.
Ces chiffres décrivent la mémoire mobilisée par le modèle, pas nécessairement toute la consommation du système. Ils ne renseignent pas non plus à eux seuls sur la vitesse de génération, l’énergie consommée, l’usure du stockage ou la qualité réelle des réponses face à des modèles moins compressés.
Notre analyse
Edge0 explore un compromis pertinent pour l’IA embarquée : utiliser la capacité du stockage comme extension de la mémoire plutôt que réduire le modèle jusqu’à ce qu’il tienne entièrement en RAM. Cette approche peut élargir les usages hors ligne et privés, mais elle ne transforme pas un téléphone en serveur haut débit. Les mesures indépendantes devront comparer latence, autonomie et qualité sur plusieurs générations d’iPhone et de Mac. L’ouverture du code et des poids rend précisément ces vérifications possibles.
Sources : annonce de Samuel Zeng, likée par RoboActu, dépôt officiel Edge0, site du projet et présentation technique d’AlphaSignal.
