Skip to main content
Hver inndata gir rangerte treff med en konfidensscore mellom 0 og 1.
Enhet
entity_name
land (opt)
bransje (opt)
lei (opt)
1 — Kandidatentiteters henting
Søker i CB-entitetsdatabasen etter sannsynlige kandidater
2 – Feature Engineering
Måler navnelikhet og samsvar mellom metadata per kandidat
3 — ML-poengberegning
Gir hver kandidat en poengsum som angir sannsynligheten for at det er et treff
Toppresultat
CBId
CBEntityName
konfidens
rangering
Denne fremstillingen viser hele identitetsavklaringsprosessen fra inndatafeltene til rangerte kandidatresultater.

Rørledningen

Henting av kandidatentiteter

CB Entity Database støtter omtrentlig tekstsøk og returnerer en kortliste med plausible kandidater. Søket bruker «BM25-rangering» – der kandidatene vurderes etter termfrekvens og invers dokumentfrekvens – og normaliserer inndatateksten for å håndtere tegnsetting, aksenter, lovbestemte suffikser og vanlige navnevarianter. Det hentes inn rundt 20 kandidater per navn. I denne fasen prioriteres «Gjenfinningsgrad fremfor presisjon»: det riktige treffet må forekomme i kandidatsettet før poengberegningen kan starte.

Funktionsutforming

For hver kandidat returneres en egenskapsvektor x\mathbf{x} Modellen er bygget opp av dusinvis av individuelle signaler, gruppert i fire kategorier:

ML-scoring

En klassifikator basert på maskinlæring tildeler hver kandidat en treffsannsynlighet uavhengig av de andre: p^=P(matchx)\hat{p} = P(\text{match} \mid \mathbf{x}) Kandidatene rangeres etter p^\hat{p} og de øverste resultatene returneres i svaret.

Opplæring

Modellen er trent på et internt datasett med titusenvis av merkede entitetsmatcher – hver av dem et par med enten riktig eller feil match. Dette skiller seg fra selve CB Entity Database, som inneholder millioner av poster som tilsvarer observerte entiteter fra bankinnleveringer. Modellen trenes på nytt hver uke i takt med at både CB Entity Database og universet for entitetsavklaring vokser.

Testing

Ytelsen evalueres ved hjelp av K-fold kryssvalidering, noe som sikrer at målingene gjenspeiler generalisering over hele det merkede datasettet, snarere enn en enkelt oppdelingsmetode mellom trenings- og testdata. Ettersom modellen omskoles på nye data, blir ytelsen revurdert for hver syklus. Klassifiseringsmålinger rapporteres på siden «Nøyaktighet og dekning».

Konfidensscore

Hver kandidat returneres med en poengsum p^[0,1]\hat{p} \in [0, 1] som gjenspeiler modellens sikkerhet for at dette er det riktige treffet. Internt bruker vi følgende intervall som retningslinjer, basert på ytelse målt på våre testdata: Disse tallene gjenspeiler trefffrekvensen per kandidat.Når flere kandidater returneres (limit > 1) med lavere poengsum, kan den riktige enheten fortsatt være til stede et sted i resultatsettet – å gjennomgå de beste kandidatene samlet øker sjansen for en korrekt identifisering, selv når ingen enkelt poengsum er høy. Se «Entitetsavklaring: Nøyaktighet og dekning» for en fullstendig analyse av avveiningen mellom terskelverdier.