
Lorsqu’un modèle d’intelligence artificielle locale occupe déjà votre Mac, une nouvelle demande peut être confiée à un autre ordinateur de la maison ou du bureau. C’est le principe de PAIR, pour Personal AI Router : cette bêta open source de NVIDIA organise la répartition de requêtes entre plusieurs machines présentes sur le même réseau, sans passer par Internet pour fonctionner.
Un seul accès pour plusieurs ordinateurs
PAIR fonctionne avec Ollama et LM Studio, deux outils servant à lancer des modèles d’IA directement sur son ordinateur. Une fois les machines associées, les applications utilisent un point de connexion unique : elles n’ont pas à être réglées séparément pour chaque Mac ou PC du réseau.
Selon NVIDIA, le routeur choisit une machine disponible à chaque nouvelle requête. Si l’un des ordinateurs est occupé ou n’est plus accessible, les prochaines demandes peuvent être orientées vers un autre appareil. Cette organisation peut notamment répartir sur plusieurs postes les tâches indépendantes d’un agent chargé d’examiner plusieurs documents.
Il ne s’agit toutefois pas de transformer plusieurs ordinateurs en une seule machine géante. PAIR ne regroupe ni la mémoire ni les GPU : deux Mac avec 16 Go de mémoire ne permettent donc pas de charger un modèle nécessitant 32 Go. Ajouter un ordinateur au réseau ne raccourcit pas non plus automatiquement le temps de réponse d’une demande isolée.
Mac M4 et macOS Tahoe au minimum
Pour les Mac, NVIDIA liste une puce M4 ou plus récente et macOS Tahoe parmi les conditions de prise en charge. Les prérequis généraux prévoient au moins 8 Go de mémoire vive et recommandent 20 Go d’espace de stockage ou davantage.
Chaque ordinateur doit posséder les ressources adaptées au modèle demandé et avoir déjà téléchargé ce modèle dans Ollama ou LM Studio. PAIR peut aussi relier des PC sous Windows ou Linux équipés d’une GeForce RTX série 20 ou ultérieure, d’une RTX Pro Turing ou plus récente, ainsi que des systèmes DGX Spark. NVIDIA indique que les requêtes, les fichiers et le contexte des agents restent sur le réseau de l’utilisateur pendant l’inférence locale.
Ce que ça change
PAIR vise surtout les foyers et petits bureaux disposant déjà de plusieurs machines compatibles, afin d’absorber plusieurs requêtes locales au même moment. Son intérêt dépendra concrètement des modèles installés sur chaque poste et de leur capacité à les exécuter. Dans une démonstration propre à sa configuration, NVIDIA a mesuré 8 minutes et 48 secondes avec un RTX Spark, un DGX Spark et une RTX 5090 répartissant une tâche entre cinq sous-agents, contre 18 minutes avec le RTX Spark seul.
À lire aussi
Source : NVIDIA — Developer Blog (Personal AI Router / PAIR)