Mesurer un assistant IA de support : déflection, précision d’intent, temps de résolution
Un assistant IA de support se juge sur trois chiffres : ce qu’il résout sans agent, ce qu’il comprend correctement, et le temps que met une demande à être réglée. Chacun est simple à énoncer et facile à gonfler. Voici comment les définir et les instrumenter pour qu’ils résistent à un comité de direction.
Pourquoi ces trois indicateurs, et pas d’autres
On peut suivre des dizaines de métriques sur un assistant : volume de conversations, satisfaction, taux de clic, coût par requête. Elles sont utiles au pilotage. Mais pour décider si le système crée de la valeur, trois questions suffisent :
- Combien de demandes sont réglées sans intervention humaine ? C’est la déflection.
- Le système comprend-il ce que la personne demande, dans la langue du métier ? C’est la précision d’intent.
- Les demandes sont-elles réglées plus vite, y compris celles qui passent par un agent ? C’est le temps de résolution.
Les trois se tiennent. Une forte déflection avec une précision faible signifie que l’on renvoie des gens dans le vide. Une bonne précision sans gain de temps signifie que le routage ne sert à rien en aval.
Déflection : ce qui est réellement résolu
Définition
Part des demandes entrantes traitées de bout en bout par l’assistant, sans création de ticket ni transfert vers un agent, et sans retour de la même personne pour le même sujet dans une fenêtre définie.
Instrumentation
- Un identifiant de conversation relié à l’identifiant client ou au logement, au dossier ou au contrat.
- Un statut de fin explicite : résolu par l’assistant, transféré, abandonné.
- Une fenêtre de recontact fixée à l’avance, par exemple sept jours, sur tous les canaux : chat, téléphone, e-mail.
Le piège
Compter comme déflectée une conversation qui se termine sans ticket, alors que la personne rappelle le lendemain. C’est l’erreur la plus courante, et elle peut faire paraître excellent un système qui ne fait que déplacer la demande vers un autre canal. Une conversation abandonnée n’est pas une conversation résolue.
Précision d’intent : comprendre dans la langue du métier
Définition
Part des demandes pour lesquelles l’intention détectée par le système correspond à l’intention réelle, établie par un humain sur un échantillon de référence.
Instrumentation
- Une taxonomie d’intentions construite avec les équipes terrain, pas dans un atelier entre consultants.
- Un jeu de référence annoté par des personnes du métier, tiré des demandes réelles, renouvelé régulièrement.
- Une mesure par intention, pas seulement globale : la moyenne cache les catégories critiques.
Le piège
Mesurer sur un vocabulaire générique. Un locataire ne parle pas comme un jeu de test : il emploie des termes maison, des abréviations, des fautes, mélange deux demandes dans un message. C’est pour cela que je précise toujours « sur le vocabulaire métier ». Une précision mesurée sur des phrases propres n’a pas de valeur en production.
Deuxième piège : exclure du calcul les messages « hors périmètre ». Ils doivent être détectés comme tels, et cette détection fait partie de la précision.
Temps de résolution : ce que vit l’utilisateur
Définition
Durée moyenne entre la première prise de contact et la résolution effective de la demande, tous canaux et toutes voies confondus : résolue par l’assistant, routée vers un agent, ou escaladée.
Instrumentation
- Un horodatage de première prise de contact et de clôture, dans le même référentiel que la période de référence.
- Une période de référence avant déploiement, mesurée de la même façon.
- Un découpage par catégorie de demande, pour comparer à mix constant.
Le piège
Choisir son périmètre après coup. Mesurer le temps de résolution uniquement sur les demandes que l’assistant résout seul, ou uniquement sur les catégories simples, donne un chiffre flatteur et faux. Le bon indicateur porte sur l’ensemble du flux, y compris les cas difficiles qui passent par un agent, et compare des périodes et des mix de demandes comparables.
L’illustration : Home Partners
Pour le contact center de Home Partners of America, parc résidentiel de 30 000 unités, le système IA qualifie, route et résout les demandes des locataires, en production sur l’ensemble du portefeuille.
Mission réalisée chez Home Partners of America, filiale du groupe Blackstone, période 2022 – 2023. Données publiques, parties prenantes informées, dans le respect des accords de confidentialité applicables.
Ce qui compte dans cette lecture, c’est la combinaison. La déflection montre le volume absorbé, la précision montre que l’absorption repose sur une compréhension réelle des demandes, et le temps de résolution dit si les clients obtiennent plus vite une réponse complète. Ces définitions sont celles que je recommande ; le cas illustre la lecture combinée des trois chiffres.
Cinq règles pour des chiffres qui tiennent
- Fixez les définitions avant le lancement, par écrit, avec le propriétaire métier.
- Mesurez une référence avant de déployer. Sans « avant », il n’y a pas de gain.
- Publiez les trois chiffres ensemble, jamais un seul.
- Faites annoter par le métier, et renouvelez l’échantillon : le vocabulaire évolue.
- Suivez les cas qui reviennent : ils disent où l’assistant échoue sans le savoir.
Et l’organisation dans tout ça ?
Ces indicateurs ne sont pas qu’un sujet de tableau de bord. Ils obligent à décider qui annote, qui arbitre la taxonomie, qui corrige quand une catégorie dérive. C’est le volet organisationnel, celui qui pèse, selon moi, 70 % d’une transformation IA réussie, et celui que l’on oublie quand on mesure un POC. Je développe ce point dans du POC IA à la production.
La logique est la même qu’en produit : un indicateur choisi avant de construire, une référence, une hypothèse à valider. C’est ce que je décris pour le market fit, et ce qui doit alimenter le backlog d’amélioration de l’assistant. Pour un usage interne plus simple, ClairAI détaille comment mesurer le gain de temps de l’IA en comptant la relecture et les corrections.