Skip to main content
Chaque entrée renvoie des correspondances classées par ordre de pertinence, assorties d’un score de confiance compris entre 0 et 1.
Entité
entity_name
pays (opt)
Secteur d’activité (opt)
lei (opt)
1 — Récupération des entités candidates
Effectue une recherche dans la base de données d’entités CB afin d’identifier des candidats potentiels
2 — Ingénierie des caractéristiques
Mesure la similarité des noms et l’alignement des métadonnées par candidat
3 — Notation par apprentissage automatique
Attribue à chaque candidat un score correspondant à une probabilité de correspondance
Résultat principal
CBId
CBEntityName
confiance
classement
Ce schéma présente le flux de travail de résolution de bout en bout, depuis les champs d’entité d’entrée jusqu’aux résultats classés par ordre de pertinence.

Pipeline

Récupération des entités candidates

La base de données d’entités CB prend en charge la recherche textuelle approximative, en renvoyant une liste restreinte de candidats plausibles. La recherche utilise l’Classement BM25 — qui attribue un score aux candidats en fonction de la fréquence des termes et de la fréquence inverse des documents — et normalise le texte saisi afin de gérer la ponctuation, les accents, les suffixes légaux et les variantes courantes des noms. Environ 20 candidats sont récupérés par nom. Cette étape donne la priorité à l’Rappel par rapport à la précision : la correspondance exacte doit figurer dans l’ensemble des candidats avant que l’évaluation des scores puisse commencer.

Ingénierie des caractéristiques

Pour chaque candidat, un vecteur de caractéristiques x\mathbf{x} est calculé à partir de dizaines de signaux individuels, regroupés en 4 catégories :

Notation par apprentissage automatique

Un classificateur d’apprentissage automatique attribue une probabilité de correspondance à chaque candidat de manière indépendante : p^=P(matchx)\hat{p} = P(\text{match} \mid \mathbf{x}) Les candidats sont classés par p^\hat{p} et les principaux résultats renvoyés dans la réponse.

Formation

Le modèle a été entraîné sur un ensemble de données interne comprenant des dizaines de milliers de correspondances d’entités étiquetées — chacune constituant une paire de correspondance vraie ou fausse. Cet ensemble est distinct de la base de données d’entités CB elle-même, qui contient des millions d’enregistrements correspondant à des entités observées sur soumissions bancaires. Le modèle est réentraîné chaque semaine, à mesure que la base de données d’entités CB et l’univers de résolution d’entités s’étoffent.

Tests

Les performances sont évaluées à l’aide de l’[Validation croisée k-fold](https://en.wikipedia.org/wiki/Cross-validation_\(statistics\), ou évaluation par échantillonnage), ce qui garantit que les indicateurs reflètent la généralisation sur l’ensemble des données étiquetées plutôt que sur un simple fractionnement entre données d’entraînement et de test. À mesure que le modèle est réentraîné sur de nouvelles données, les performances sont réévaluées à chaque cycle. Les indicateurs de classification sont présentés sur la page «Précision et couverture».

Score de confiance

Chaque candidat est renvoyé avec un score p^[0,1]\hat{p} \in [0, 1] reflétant le degré de certitude du modèle quant à la justesse de la correspondance. En interne, nous utilisons les fourchettes suivantes à titre indicatif, sur la base des performances mesurées sur nos données de test : Ces chiffres reflètent les taux de correspondance par candidat. Lorsque plusieurs candidats sont proposés (limit > 1) avec des scores plus faibles, l’entité réelle peut tout de même se trouver quelque part dans l’ensemble de résultats — l’examen collectif des meilleurs candidats améliore les chances d’une résolution correcte, même lorsqu’aucun score n’est particulièrement élevé. Consultez la section « Résolution d’entités : précision et couverture » pour une analyse complète du compromis entre seuils.