Entità
entity_name
Paese (opt)
Settore (opt)
lei (opt)
1 — Recupero delle entità candidate
Esegue una ricerca nel database delle entità CB alla ricerca di candidati probabili
2 — Ingegneria delle caratteristiche
Misura la somiglianza dei nomi e l’allineamento dei metadati per ciascun candidato
3 — Punteggio ML
Assegna a ciascun candidato un punteggio che rappresenta la probabilità di corrispondenza
Risultato principale
CBId
CBEntityName
fiducia
rango
Pipeline
Recupero delle entità candidate
Il database delle entità CB supporta la ricerca testuale approssimativa, restituendo un elenco ristretto di candidati plausibili. Il recupero utilizza l’Classifica BM25 — che assegna un punteggio ai candidati in base alla frequenza dei termini e alla frequenza inversa dei documenti — e normalizza il testo in ingresso per gestire punteggiatura, accenti, suffissi legali e varianti comuni dei nomi. Vengono recuperati circa 20 candidati per ogni nome. In questa fase viene data priorità all’ricordo rispetto alla precisione e: la corrispondenza corretta deve comparire nell’insieme dei candidati prima che possa iniziare l’assegnazione dei punteggi.Ingegneria delle caratteristiche
Per ciascun candidato, un vettore di caratteristiche è costituito da decine di segnali individuali, raggruppati in 4 categorie:Punteggio ML
Un classificatore basato sull’apprendimento automatico assegna una probabilità di corrispondenza a ciascun candidato in modo indipendente: I candidati sono classificati in base a e i risultati principali restituiti nella risposta.Addestramento
Il modello è stato addestrato su un set di dati interno composto da decine di migliaia di corrispondenze di entità etichettate — ciascuna delle quali costituisce una coppia di corrispondenza vera o falsa. Ciò è distinto dal database delle entità CB stesso, che contiene milioni di record corrispondenti alle entità osservate su dati inviati dalle banche. Il modello viene riaddestrato settimanalmente man mano che sia il database delle entità CB sia l’universo di risoluzione delle entità crescono.Test
Le prestazioni vengono valutate mediante [Validazione incrociata k-fold](https://en.wikipedia.org/wiki/Cross-validation_\(statistics\), garantendo che le metriche riflettano la generalizzazione sull’intero set di dati etichettato piuttosto che su una singola suddivisione tra set di addestramento e di test. Man mano che il modello viene riaddestrato su nuovi dati, le prestazioni vengono rivalutate ad ogni ciclo. Le metriche di classificazione sono riportate nella pagina “Accuratezza e copertura”.Punteggio di affidabilità
Ogni candidato viene restituito con un punteggio che riflette la certezza del modello riguardo alla correttezza della corrispondenza. A livello interno, utilizziamo le seguenti fasce come linea guida, sulla base delle prestazioni misurate sui nostri dati di test:
Queste cifre riflettono i tassi di corrispondenza per singolo candidato. Quando vengono restituiti più candidati (
limit > 1) con punteggi inferiori, l’entità corretta potrebbe comunque essere presente da qualche parte nel set di risultati: esaminare collettivamente i candidati principali migliora le probabilità di una risoluzione corretta anche quando nessun punteggio singolo è elevato.
Si veda «Risoluzione delle entità: accuratezza e copertura» per un’analisi completa del compromesso tra soglie.
