
Depuis quelques mois, de nombreuses rumeurs circulent sur les projets d’Apple concernant des wearables intégrant de l’IA. Ces lunettes connectées, qui devraient rivaliser avec les Meta Ray-Bans, pourraient voir le jour autour de 2027, en parallèle avec des AirPods dotés de caméras offrant également des fonctionnalités basées sur l’IA.
Bien qu’il soit encore trop tôt pour connaître leur apparence précise, Apple vient de donner un aperçu de leurs capacités en matière d’IA.
En 2023, l’équipe de recherche en apprentissage automatique d’Apple a lancé MLX, un framework d’apprentissage automatique ouvert spécifiquement conçu pour le Silicon d’Apple.
En résumé, MLX offre un moyen léger d’entraîner et d’exécuter des modèles localement sur les appareils Apple, tout en restant familier pour les développeurs habitués aux frameworks plus traditionnels liés au développement de l’IA.
Apple a également introduit FastVLM, un Modèle de Langage Visuel (VLM) qui tire parti de MLX pour offrir un traitement d’images haute résolution presque instantané, tout en nécessitant beaucoup moins de ressources de calcul que les modèles similaires. Comme le souligne Apple :
« Basé sur une analyse d’efficacité exhaustive des interactions entre la résolution d’image, la latence visuelle, le nombre de tokens et la taille des LLM, nous vous présentons FastVLM — un modèle qui atteint un compromis optimisé entre latence, taille du modèle et précision. »
Au cœur de FastVLM se trouve un encodeur appelé FastViTHD, conçu spécifiquement pour une performance efficace des VLM sur des images haute résolution.
Ce modèle est jusqu’à 3,2 fois plus rapide et 3,6 fois plus petit que les modèles similaires, ce qui est un atout considérable si l’on souhaite que l’appareil traite les informations localement, sans dépendre du cloud pour générer une réponse aux requêtes de l’utilisateur.
De plus, FastVLM a été conçu pour produire moins de tokens, un élément clé lors de l’inférence, c’est-à-dire à l’étape où le modèle interprète les données et génère une réponse. Selon Apple, son modèle possède un temps de première réponse 85 fois plus rapide que les modèles similaires, ce qui signifie que moins de tokens sur un modèle plus rapide et léger se traduit par un traitement plus rapide.
FastVLM est disponible sur GitHub, tandis que le rapport peut être consulté sur arXiv.