
Les chercheurs en intelligence artificielle d’Apple sont confrontés à une crise de confiance, entraînant le départ de plusieurs cadres supérieurs.
Il y a quelques mois, Apple a lancé FastVLM, un modèle de langage visuel (Visual Language Model) capable de traiter les images à haute résolution quasiment instantanément. Désormais, vous pouvez l’essayer, à condition de disposer d’un Mac avec puce Apple Silicon. Voici comment procéder.
Lors de notre première présentation de FastVLM, nous avions souligné qu’il exploitait MLX, le cadre d’apprentissage automatique (ML) open-source d’Apple, spécifiquement conçu pour Apple Silicon. Ce modèle offre un sous-titrage vidéo jusqu’à 85 fois plus rapide tout en étant trois fois plus léger que des modèles similaires.
Depuis, Apple a poursuivi le développement de ce projet, qui est désormais accessible sur Hugging Face et non plus seulement sur GitHub. Sur Hugging Face, vous pouvez charger la version allégée FastVLM-0.5B directement dans votre navigateur et tester ses capacités.
Selon votre matériel, le temps de chargement peut varier. Pour ma part, cela a pris quelques minutes sur mon MacBook Pro M2 Pro de 16 Go. Une fois chargé, le modèle a commencé à décrire avec précision mon apparence, la pièce derrière moi, mes expressions, ainsi que les objets que j’apportais à l’écran.
Dans le coin inférieur gauche, vous pouvez ajuster le prompt que le modèle prendra en compte en mettant à jour en direct le sous-titrage, ou choisir parmi quelques suggestions, telles que :
- Décrire ce que vous voyez en une phrase.
- Quelle est la couleur de ma chemise ?
- Identifier tout texte ou contenu écrit visible.
- Quelles émotions ou actions sont représentées ?
- Nommer l’objet que je tiens dans ma main.
Si vous souhaitez explorer davantage, essayez d’utiliser une application de caméra virtuelle pour alimenter l’outil en vidéo et visionner sa capacité à décrire instantanément plusieurs scènes en détail. Bien sûr, l’utilisation réelle pourrait être différente, mais cela souligne la rapidité et la précision du modèle.
Un aspect particulièrement intéressant de cette expérience est qu’elle s’exécute localement dans le navigateur, garantissant qu’aucune donnée ne quitte l’appareil. Elle fonctionne également hors ligne, ce qui représente un cas d’utilisation idéal pour les technologies portables et d’assistance, où légèreté et faible latence sont essentielles.
À noter que la démo fonctionne sur le modèle allégé de 0,5 milliard de paramètres, tandis que la famille FastVLM inclut également des variantes plus grandes et plus puissantes avec 1,5 milliard et 7 milliards de paramètres. Des modèles plus grands pourraient offrir des performances et une rapidité encore améliorées, mais les exécuter directement dans le navigateur risque d’être impossible.
Avez-vous testé FastVLM ? Partagez vos impressions dans les commentaires.