Un assistant vocal est une chaîne de traitement, pas une intelligence unique. Le mot d'activation est reconnu localement, par un petit modèle qui tourne sur l'appareil ; tout ce qui suit part vers les serveurs du fournisseur, où la parole est transcrite, interprétée, puis convertie en action. C'est cette architecture qui explique à la fois la qualité des réponses et les questions de confidentialité.
La détection du mot-clé fonctionne en continu, sur un flux audio qui ne quitte pas l'appareil. Une fois déclenchée, la transcription automatique convertit le son en texte, puis un modèle de compréhension identifie l'intention, mettre une minuterie, allumer une lampe, chercher une information, et en extrait les paramètres. La synthèse vocale referme la boucle.
Chaque étape a son taux d'erreur, et ils se cumulent. C'est pourquoi un assistant échoue plus souvent sur une phrase longue que sur trois phrases courtes, et pourquoi les noms propres, les accents régionaux et les environnements bruyants restent les points faibles.
La qualité vocale des principaux assistants est désormais comparable. Ce qui les distingue vraiment, c'est l'écosystème d'objets qu'ils pilotent. Une ampoule, une prise ou un thermostat annonce sa compatibilité avec un ou deux assistants, rarement les trois. Choisir l'assistant après avoir acheté les objets conduite à des installations où rien ne se parle.
La bonne méthode est l'inverse : lister les objets qu'on possède et ceux qu'on prévoit, vérifier leur compatibilité, puis choisir. Le standard Matter change progressivement la donne en rendant les objets pilotables par plusieurs assistants à la fois, mais la couverture reste partielle et les fonctions avancées passent encore par l'application du fabricant.
Les tâches à intention claire et paramètre unique fonctionnent bien : minuteries, réveils, météo, conversion d'unités, lecture de musique, commande d'un objet connecté nommé sans ambiguïté. Les listes de courses et les rappels aussi, à condition d'accepter la synchronisation avec un compte.
Ce qui échoue : les demandes en plusieurs étapes, les questions dont la réponse dépend du contexte de la conversation précédente, les noms d'objets proches, « lampe salon » et « lampe salle », et tout ce qui suppose de consulter un service non intégré. L'écart entre la démonstration commerciale et l'usage quotidien tient presque entièrement à ces cas.
La distinction est importante : le microphone écoute en permanence, mais l'enregistrement ne part qu'après détection du mot d'activation. Le problème est que cette détection se trompe, une syllabe proche suffit, et que le fragment capté part alors sur les serveurs.
Trois réglages valent d'être faits le jour de l'installation : couper la conservation des enregistrements, désactiver leur analyse humaine pour amélioration du service, et supprimer l'historique existant. Les enceintes disposent toutes d'une coupure matérielle du microphone : c'est la seule garantie réelle, parce qu'elle ne dépend pas d'un logiciel.
Reste la question des tiers. Une compétence ou une action installée depuis une boutique accède à ce qu'elle demande dans ses autorisations, et ces autorisations se lisent aussi peu que les conditions d'utilisation.
Les modèles de langage récents améliorent nettement la compréhension des demandes formulées librement, et permettent d'enchaîner des instructions. En contrepartie, ils augmentent la dépendance au réseau et la quantité de données envoyée. Des versions embarquées, tournant sur l'appareil, commencent à apparaître : c'est de ce côté que se jouera la conciliation entre qualité et confidentialité.