Skip to main content
Cada entrada devuelve coincidencias clasificadas con una puntuación de confianza comprendida entre 0 y 1.
Entidad
entity_name
país (opc.)
sector (opc.)
lei (opc.)
1 — Recuperación de entidades candidatas
Busca en la base de datos de entidades de CB los candidatos más probables
2 — Ingeniería de características
Mide la similitud de nombres y la alineación de metadatos por candidato.
3 — Puntuación de aprendizaje automático
Asigna a cada candidato una puntuación que representa la probabilidad de coincidencia.
Resultado principal
CBId
CBEntityName
confianza
rango
Este flujo muestra el proceso de resolución de principio a fin, desde los campos de entidad de entrada hasta los resultados de candidatos clasificados.

Proceso

Recuperación de entidades candidatas

La base de datos de entidades de CB admite la búsqueda aproximada de texto, devolviendo una lista reducida de candidatos plausibles. La recuperación utiliza el método «Clasificación BM25» —que puntúa a los candidatos según la frecuencia de los términos y la frecuencia inversa de los documentos— y normaliza el texto de entrada para gestionar la puntuación, los acentos, los sufijos legales y las variantes comunes de los nombres. Se recuperan alrededor de 20 candidatos por nombre. En esta etapa se da prioridad a la «Recuperación frente a precisión»: la coincidencia verdadera debe aparecer en el conjunto de candidatos antes de que pueda comenzar la puntuación.

Ingeniería de características

Para cada candidato, un vector de características x\mathbf{x} se basa en docenas de señales individuales, agrupadas en 4 categorías:

Puntuación de aprendizaje automático

Un clasificador de aprendizaje automático asigna una probabilidad de coincidencia a cada candidato de forma independiente: p^=P(matchx)\hat{p} = P(\text{match} \mid \mathbf{x}) Los candidatos se clasifican según p^\hat{p} y los principales resultados devueltos en la respuesta.

Entrenamiento

El modelo se ha entrenado con un conjunto de datos interno compuesto por decenas de miles de coincidencias de entidades etiquetadas —cada una de ellas un par de coincidencia verdadera o falsa—. Esto difiere de la propia Base de datos de entidades de CB, que contiene millones de registros correspondientes a entidades observadas en envíos bancarios. El modelo se vuelve a entrenar semanalmente a medida que crecen tanto la Base de datos de entidades de CB como el universo de resolución de entidades.

Pruebas

El rendimiento se evalúa mediante el método «[Validación cruzada de k pliegos](https://en.wikipedia.org/wiki/Cross-validation_\(statistics\)», lo que garantiza que las métricas reflejen la generalización en todo el conjunto de datos etiquetado, en lugar de basarse en una única división entre entrenamiento y prueba. A medida que el modelo se vuelve a entrenar con nuevos datos, el rendimiento se reevalúa en cada ciclo. Las métricas de clasificación se recogen en la página «Precisión y cobertura».

Puntuación de confianza

Cada candidato se devuelve con una puntuación p^[0,1]\hat{p} \in [0, 1] refleja la certeza del modelo de que se trata de la coincidencia correcta. A nivel interno, utilizamos los siguientes rangos como orientación, basándonos en el rendimiento medido con nuestros datos de prueba: Estas cifras reflejan las tasas de coincidencia por candidato. Cuando se devuelven varios candidatos (limit > 1) con puntuaciones más bajas, la entidad correcta puede seguir estando presente en algún lugar del conjunto de resultados; revisar los principales candidatos de forma conjunta mejora las posibilidades de una resolución correcta, incluso cuando ninguna puntuación individual es elevada. Consulte «Resolución de entidades: precisión y cobertura» para obtener un análisis completo de la relación entre umbrales.