La plupart des scores de santé client ne fonctionnent pas. Dans l'étude Customer Revenue Leadership menée par ChurnZero en 2025 auprès de près de 800 responsables post-vente, 73 % déclarent que leur score de santé ne prédit pas fiablement le churn. Ce n'est pas un problème d'outil : la plupart de ces équipes disposent d'une plateforme qui calcule un score. C'est un problème de conception, et pour une partie d'entre eux, un problème de matière première.
Un score utile repose sur quatre mesures indépendantes — ce que le client dit, ce que la relation lui coûte, si elle est encore vivante, ce que dit le contrat — notées par rapport aux comptes comparables plutôt qu'à un seuil universel, et pondérées davantage par leur tendance que par leur niveau. Ce guide détaille le calcul, les seuils, les pièges, et ce qu'il faut exiger d'un outil avant de l'acheter.
Qu'est-ce qu'un score de santé client ?
Un score de santé client (customer health score) est un indice composite, généralement noté de 0 à 100 ou affiché en rouge / orange / vert, qui résume la probabilité qu'un compte renouvelle, parte ou se développe. Il agrège plusieurs signaux plutôt que d'en juger un seul.
Il sert à une chose : trier un portefeuille. Un CSM qui suit 200 comptes ne peut pas tous les examiner chaque semaine. Le score lui dit par lesquels commencer. Cette finalité impose deux exigences que la plupart des implémentations oublient :
- Comparabilité — un 62 et un 48 doivent vouloir dire quelque chose l'un par rapport à l'autre, sinon le tri est arbitraire.
- Explicabilité — un CSM qui voit un compte passer au rouge sans savoir pourquoi n'agira pas, et il aura raison.
Quelles données entrent dans le calcul ?
Quatre familles de signaux suffisent à couvrir ce qu'on peut observer d'un compte B2B sans instrumenter son produit, c'est-à-dire avec un CRM, un outil de support, la téléphonie et la messagerie.
| Dimension | Poids de référence | Ce qu'elle mesure |
|---|---|---|
| Voix du client | 35 % | Le ton des échanges, les signaux explicites de risque, le NPS ou CSAT déclaré |
| Friction | 25 % | Allers-retours par ticket, réouvertures, escalades, délais de résolution |
| Engagement | 20 % | Récence du dernier contact, réciprocité des échanges, couverture des rôles clés, départs de contacts |
| Santé contractuelle | 20 % | Trajectoire de l'ARR, proximité du renouvellement, statut de paiement, ancienneté |
Deux principes gouvernent l'ajustement de ces poids :
- Si vous avez les données d'usage produit, ajoutez une cinquième dimension, l'Adoption, autour de 20 %, et redescendez la Voix à 30 %.
- Si vous ne les avez pas, ne montez pas la Voix au-delà d'un tiers du score. C'est la dimension la moins auditable, parce qu'elle repose sur l'interprétation de textes. Lui faire porter la majorité du chiffre rend le score indéfendable dès qu'on le conteste.
Pourquoi ces dimensions doivent rester indépendantes
Le point qui déroute au départ : ces dimensions regardent souvent le même échange, mais n'y lisent pas la même chose. Un mail reçu le 12 mars :
- La Voix lit le contenu — le ton est tendu, un concurrent est nommé.
- L'Engagement lit le flux — c'est le client qui a écrit, et c'est son premier message entrant depuis six semaines. Le texte est ignoré.
- La Friction n'y lit rien — elle ne regarde que les tickets, et y compte les réouvertures et les délais.
C'est cette indépendance qui rend le score robuste. Un client peut être poli et partir quand même : la Voix ne verra rien, l'Engagement verra le silence.
Faut-il noter le niveau ou la tendance ?
Les deux, et la tendance doit peser davantage. Chaque dimension mesure où en est le compte aujourd'hui (le niveau) et dans quel sens il bouge (la tendance, en comparant les 90 derniers jours aux 90 précédents). Un mélange qui fonctionne : 40 % de niveau, 60 % de tendance.
La raison est opérationnelle. Un compte moyen qui se dégrade est plus urgent qu'un compte médiocre mais stable depuis deux ans : le second fonctionne comme ça, le premier est en train de vous échapper. Un score qui ne note que le niveau vous fera passer vos journées sur les comptes structurellement bruyants et vous fera rater les décrochages.
Seuil fixe ou comparaison entre comptes ?
Comparaison. C'est la différence la plus visible entre un score qui sert et un score qu'on finit par ignorer.
Trois tickets par mois, c'est beaucoup ou c'est peu ? La question n'a pas de réponse dans l'absolu. Trois tickets pour une TPE de huit personnes, c'est énorme. Dix pour une ETI de 500 salariés, c'est le fonctionnement normal. Un seuil universel se trompe dans les deux sens : il noie l'équipe sous les alertes des gros comptes et rend invisibles les petits qui décrochent.
- Normalisez par cohorte — chaque compte est comparé aux comptes de même segment et d'ancienneté voisine.
- En dessous d'environ 50 comptes par cohorte, comparez au portefeuille entier : comparer à un échantillon trop petit produit des scores qui bougent tout seuls.
- Recalculez les références périodiquement — un portefeuille qui grossit change ses propres normes.
Où placer les seuils rouge, orange et vert ?
Pas à des valeurs fixes du type « en dessous de 50, c'est rouge ». Calez les bandes sur la distribution réelle de votre portefeuille, avec une cible du type 7 % en critique et 19 % à risque.
Le critère n'est pas statistique, il est opérationnel : une liste rouge doit rester traitable par l'équipe qui doit la traiter. Un CSM qui ouvre son écran et voit 60 % du portefeuille en alerte ne priorise rien. Il retourne à son intuition, et le score devient un badge décoratif.
Encadrez quand même cette calibration par des bornes absolues, sinon un pourcentage cible appliqué mécaniquement finira toujours par trouver ses 7 % de comptes critiques, y compris dans un portefeuille réellement sain.
Les trois erreurs qui rendent un score inutilisable
1. Traiter tous les signaux de risque à égalité
Un concurrent nommé explicitement et une mention de « contrainte budgétaire » n'ont pas la même valeur prédictive. Si vous les comptez pareil, votre score alerte sur la moitié du portefeuille.
- Signaux forts — concurrent nommé, demande de clause de sortie, demande d'export complet des données en fin de contrat. Ils doivent déclencher seuls, même si le reste du compte est vert.
- Signaux faibles — mention de budget, réorganisation interne, changement d'interlocuteur. Réels mais ambigus : ils ne comptent qu'accompagnés d'un second signal ou d'un ton négatif.
2. Transformer l'inconnu en neutre
C'est l'erreur la plus silencieuse. Un échange qu'on n'a pas su interpréter, une dimension dont on n'a pas les données : la tentation est de mettre une valeur moyenne pour que le calcul aboutisse. Résultat, un compte mal connu apparaît vert — exactement le silence qu'on cherchait à éliminer.
- Affichez une couverture avec chaque score : la part de ce qui a réellement pu être mesuré.
- En dessous de 50 % de couverture, n'affichez pas de score. Écrivez « données insuffisantes ».
- Redistribuez, ne comblez pas — une dimension trop peu mesurable sort du calcul, elle ne reçoit pas une note par défaut.
3. Laisser la moyenne effacer les cas dangereux
Une somme pondérée neutralise mécaniquement les profils contradictoires, qui sont précisément les plus prédictifs. Trois configurations à sortir du calcul et à traiter comme des alertes propres :
- Le captif mécontent — usage fort, voix négative. La moyenne le rend vert. Il part net à l'échéance, sans préavis relationnel.
- Le décrochage silencieux — effondrement du volume d'échanges entrants sans qu'un mot négatif ait été écrit. Le cas le plus fréquent, et le moins détecté.
- La patience à risque — voix positive malgré une friction élevée. Ce n'est pas une alerte de churn, c'est un interdit d'upsell tant que l'irritant n'est pas levé.
Le silence, en particulier, ne doit jamais être lu comme de la satisfaction. Il se juge par rapport au rythme habituel du compte lui-même : « n'a rien dit depuis 40 jours » n'a de sens que comparé à sa propre habitude.
L'angle mort : la matière première du score
Les trois erreurs ci-dessus se corrigent en changeant la formule. Il reste un problème qu'aucune pondération ne résout, et qui explique une bonne part des 73 % cités en ouverture : un score ne peut pas voir ce que ses sources ne contiennent pas.
- Le signal calculé sur une seule source. Un CRM qui détecte lui-même le sentiment ne voit que ce qui transite par le CRM. Or le client écrit au support, appelle, envoie des mails. Un sentiment mesuré sur un seul canal ne permet ni de comparer les canaux entre eux, ni de repérer un décrochage — qui se manifeste précisément dans le canal où le client s'est tu.
- La domination de la télémétrie produit. La plupart des plateformes construisent d'abord le score sur l'usage. C'est efficace pour un produit à usage quotidien, et aveugle pour un éditeur dont la relation passe par des humains — comme pour les comptes qui se connectent tous les jours et partent quand même.
- L'absence de trace jusqu'à l'échange. Beaucoup d'outils indiquent quelle dimension a baissé. Peu ramènent au mail daté ou au ticket précis qui l'explique. Sans cette trace, le CSM refait l'enquête à la main, et le score lui fait gagner une minute au lieu d'une heure.
Ces trois points ne sont pas des défauts d'implémentation : ils découlent du choix des sources et de l'architecture. C'est pour ça qu'une équipe peut passer six mois à configurer un scoring et se retrouver avec un chiffre auquel personne ne se fie.
Faut-il que l'IA calcule le score ?
Non, et c'est un choix d'architecture plutôt que de prudence. Un modèle de langage sait faire une chose que rien d'autre ne sait faire : lire un ticket, un mail ou un compte rendu d'appel, et en extraire un ton, des signaux nommés et un résumé. Il doit s'arrêter là. Ce qui suit est de l'arithmétique.
- Vous pouvez expliquer le chiffre — un analyste muni de vos données et de la grille de pondération refait le calcul à la main et retombe sur le même résultat.
- Vous pouvez débrancher l'IA — le score continue de sortir, avec une couverture moindre sur la Voix. Un système où retirer le modèle casse tout est un système que personne ne peut vérifier.
- Le coût reste maîtrisé — un score recalculé chaque nuit par un modèle coûte un ordre de grandeur de plus qu'une somme pondérée.
La nuance à assumer : une des entrées vient bien d'une IA, et cette étape n'est pas reproductible à l'identique. Ce qui l'encadre, c'est de ne classifier chaque texte qu'une fois et de stocker le résultat, d'enregistrer la version du prompt avec lui, et de conserver le résumé produit pour savoir sur quoi le jugement portait.
Quels outils calculent un score de santé client ?
Les plateformes de Customer Success — Gainsight, ChurnZero, Totango, Planhat, Vitally, Custify — permettent toutes de composer un indice pondéré à partir de l'usage produit, du cycle de vie, de l'activité de support et des enquêtes de satisfaction, puis de déclencher des actions quand un compte passe à l'orange ou au rouge. Il reste également possible de construire un premier score à la main, dans un tableur ou dans le CRM — bonne façon de valider les dimensions qui comptent chez vous, tant que le portefeuille reste sous la centaine de comptes, comme le détaille le guide sur le suivi de la rétention sous Excel.
Quatre questions à poser à un éditeur avant de signer, qui recoupent les angles morts décrits plus haut :
- Quelles sources lisez-vous ? Si la réponse se limite à la télémétrie produit et à un champ de sentiment rempli par le CSM, le score héritera de cet angle mort.
- Puis-je remonter du score à l'échange qui l'explique ? Demandez la démonstration sur un compte réel, pas la capture d'écran.
- Que se passe-t-il quand une donnée manque ? S'il n'existe pas de notion de couverture, les comptes mal connus seront verts.
- Comment vérifiez-vous que le score détecte vraiment ? Demandez un rétro-test, avec la précision et le rappel, pas seulement un taux de détection.
À retenir
- Quatre dimensions indépendantes : ce qui est dit, ce que la relation coûte au client, si elle est vivante, ce que dit le contrat.
- La tendance pèse plus que le niveau — 60 contre 40.
- Comparez chaque compte à ses pairs, jamais à un seuil universel.
- En dessous de 50 % de couverture, pas de score du tout.
- Calez vos bandes pour qu'une liste rouge reste traitable : environ 7 % en critique.
- Sortez signaux forts et profils contradictoires de la moyenne, sinon elle les efface.
- Un score ne voit que ses sources : si vos clients parlent par mail, téléphone et support, un score bâti sur l'usage produit ne les entendra pas.
Questions fréquentes
Quelle différence entre un score de santé client et un NPS ?
Le NPS est une mesure déclarative, ponctuelle et volontaire : il ne renseigne que sur les clients qui répondent, au moment où ils répondent. Le score de santé est calculé en continu sur l'ensemble du portefeuille à partir de données observées. Le NPS est une des entrées possibles du score, pas son équivalent — le sujet est détaillé dans un guide séparé.
À quelle fréquence recalculer un score de santé ?
Quotidiennement suffit dans la quasi-totalité des cas B2B. Les signaux qui composent le score — tickets, échanges, ARR — bougent à l'échelle du jour, pas de la minute. Ce qui compte davantage, c'est de conserver l'historique quotidien pour lire une trajectoire.
Combien de comptes faut-il pour qu'un score de santé ait du sens ?
La normalisation par cohorte demande un minimum de comparables : en dessous d'une cinquantaine de comptes, les scores deviennent instables. Il faut aussi de la profondeur historique — six à douze mois d'échanges — pour qu'une tendance existe.
Un score de santé peut-il vraiment prédire le churn ?
Il ne prédit pas, il priorise. Un bon score identifie les comptes qui méritent votre attention cette semaine et explique pourquoi. La décision de ce qu'il faut faire, et le résultat obtenu, restent le travail de l'équipe. Un score présenté comme une prédiction de churn se discrédite au premier faux positif.
Sources et méthode. Le chiffre de 73 % provient de l'étude Customer Revenue Leadership publiée par ChurnZero en 2025, menée auprès de près de 800 responsables post-vente. Les capacités de scoring des plateformes citées sont établies d'après leurs documentations publiques. Les pondérations et seuils proposés sont un modèle de référence issu de la pratique et d'entretiens avec des responsables Customer Success d'éditeurs SaaS B2B : ils sont à calibrer sur votre portefeuille, pas à reprendre tels quels.
Philippe Kanaan est le fondateur de marsā. Basé à Marseille.