> ## Documentation Index
> Fetch the complete documentation index at: https://docs.creditbenchmark.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Accuratezza e copertura

> Parametri di riferimento delle prestazioni per la risoluzione delle entità di Credit Benchmark: metriche di precisione, richiamo e copertura misurate su un set di valutazione tenuto a parte.

## Set di dati

Le prestazioni vengono valutate su un insieme di nomi di entità tenuti da parte, che sono stati deliberatamente esclusi dalla fase di addestramento affinché il modello non li abbia mai osservati. Tale procedura garantisce che la valutazione rifletta la capacità di generalizzazione del modello, e non una semplice memorizzazione.

Per ciascun nome, la fase di recupero restituisce circa 25 candidati dal database Credit Benchmark. Le prestazioni vengono misurate a **livello** di **coppia candidato-nome**: ogni combinazione nome-candidato costituisce un esempio etichettato.

|                                    | Valore                                                                     |
| ---------------------------------- | -------------------------------------------------------------------------- |
| Nomi di entità esclusi             | **1.544**                                                                  |
| Coppie di candidati etichettate    | **39.051**                                                                 |
| Media delle candidature per entità | **25.3**                                                                   |
| Coppie di corrispondenza vera      | **1.544**                                                                  |
| Coppie non corrispondenti          | **37.507**                                                                 |
| Equilibrio delle classi            | **Si osservano circa 24 non corrispondenze per ogni corrispondenza vera.** |

Poiché solo un candidato per nome è corretto, il set di dati risulta fortemente sbilanciato, riflettendo la distribuzione reale che il modello incontra in produzione. Le prestazioni vengono rivalutate ad ogni ciclo di riaddestramento settimanale.

## Matrice di confusione

**Cosa misura:**

L'[Matrice di confusione](https://en.wikipedia.org/wiki/Confusion_matrix) e valuta il modello come un classificatore binario alla soglia $\hat{p} \geq 0.60$I candidati al di sopra della soglia vengono considerati corrispondenze; tutti gli altri, non corrispondenze.

**Risultato:**

<CardGroup cols={2}>
  <Card title="Vero positivo — 1.291" color="#22c55e" icon="check">
    **83.61%** delle corrispondenze effettive identificate correttamente
  </Card>

  <Card title="Falsi positivi: 110" color="#ef4444" icon="x">
    **0.29%** di effettivi casi di mancata corrispondenza segnalati erroneamente.
  </Card>

  <Card title="Falsi negativi — 253" color="#f59e0b" icon="minus">
    **16.39%** Le corrispondenze effettive al di sotto della soglia vengono segnalate per ulteriore revisione.
  </Card>

  <Card title="Vero negativo — 37.397" color="#22c55e" icon="check">
    **99.71%** di effettivi non corrispondenti correttamente scartati
  </Card>
</CardGroup>

Da tali conteggi si ricavano due metriche:

**Ricordo: quale frazione delle corrispondenze vere è stata identificata correttamente dal modello?**

* Su 1.544 abbinamenti corretti presenti nel set di test, 1.291 hanno ottenuto un punteggio superiore alla soglia. $\text{Recall} = \frac{T_p}{T_p + F_n} = \frac{1{,}291}{1{,}291 + 253} = 83.6\%$
  I 253 falsi negativi rappresentano corrispondenze che hanno ottenuto un punteggio inferiore alla soglia di confidenza dell'0.6.
* In pratica, Credit Benchmark osserva che la corrispondenza effettiva risulta comunque nel set di output, anche quando l’affidabilità della corrispondenza corretta è inferiore a 0,6.

**Punteggio F1: qual è la performance combinata del modello in termini di richiamo e precisione?**

* F1 è la media armonica di Ricordo e Precisione, e penalizza lo squilibrio tra le due metriche, premiando i modelli che ottengono buoni risultati su entrambi. $F_1 = \frac{2T_p}{2T_p + F_p + F_n} = \frac{2 \times 1{,}291}{2 \times 1{,}291 + 110 + 253} = 87.7\%$
  Un punteggio F1 pari a {F1} alla soglia {soglia} attesta un’elevata capacità di classificazione: il modello individua la maggior parte delle corrispondenze vere limitando al contempo le previsioni errate.

## Curva ROC e precisione-richiamo

Poiché il set di dati è fortemente sbilanciato (rapporto circa 24:1), la curva Precisione-Richiamo rappresenta l’indicatore più informativo — [L’AUC della curva ROC può risultare ingannevolmente ottimistica in contesti sbilanciati.](https://en.wikipedia.org/wiki/Receiver_operating_characteristic#Limitations).

<Frame caption="ROC curve (left) and Precision–Recall curve (right) on the held-out test set.">
  <img src="https://mintcdn.com/creditbenchmark/mmxvP-jd6tVp2TN0/images/api/matching/roc_pr_curves.png?fit=max&auto=format&n=mmxvP-jd6tVp2TN0&q=85&s=bb22423d7b70f3e74cd8dedb838b1987" alt="ROC and Precision-Recall curves" style={{ width:"100%" }} width="1875" height="721" data-path="images/api/matching/roc_pr_curves.png" />
</Frame>

### Curva ROC

**Cosa misura:** l'efficacia con cui il modello separa le corrispondenze dai non corrispondenti per tutte le soglie possibili. Il grafico "[Curva ROC](https://en.wikipedia.org/wiki/Receiver_operating_characteristic)" (tasso di veri positivi contro tasso di falsi positivi) rappresenta il tasso di veri positivi in funzione del tasso di falsi positivi mentre la soglia varia da 1 a 0:

* $\text{TPR} = \frac{T_p}{T_p + F_n}, \qquad \text{FPR} = \frac{F_p}{F_p + T_n}$

L’area sotto tale curva (AUC) sintetizza le capacità discriminanti del modello: un valore di 1.0e è ottimale, mentre un valore di 0.5e non è superiore a un risultato casuale.

**Risultato:** AUC =**0.989**, indicativo di una separazione quasi perfetta tra corrispondenze vere e non corrispondenze.

### Curva precisione-richiamo

**Cosa misura:** quanta precisione mantiene il modello man mano che recupera più corrispondenze. \[Precisione media (AP)]\([https://en.wikipedia.org/wiki/Evaluation\_measures\_\\(information\_retrieval\\)](https://en.wikipedia.org/wiki/Evaluation_measures_\\\(information_retrieval\\\)) #Average\_precision) riassume questo concetto come l'area ponderata sotto la curva PR:

* $\text{Average Precision} = \sum_{n} (R_n - R_{n-1}) \cdot P_n$

dove:

* $R_n$ — richiamo al livello di soglia $n$
* $P_n$ — precisione al livello di soglia $n$

L'AP è più significativo dell'AUC quando gli esempi positivi sono rari — l'AP = 1.0 indica una classificazione perfetta.

**Risultato:** AP =**0.936** — elevata precisione mantenuta nella maggior parte dell’intervallo di richiamo.

## Compromesso tra precisione e copertura

**Cosa misura:**

[Precisione](https://en.wikipedia.org/wiki/Precision_and_recall) è la percentuale di corrispondenze previste che sono effettivamente corrette. La copertura è la percentuale di nomi inseriti che ricevono una corrispondenza superiore alla soglia. $k$:

* $\text{Precision}(k) = \frac{T_p}{T_p + F_p}, \qquad \text{Coverage}(k) = \frac{n_{\geq k}}{N}$

dove:

* $n_{\geq k}$ — numero di nomi con punteggio pari o superiore a $k$
* $N$ — numero totale di nomi inseriti

A una soglia $k$ Modifiche:

* **Aumento** $k$ — meno nomi corrispondenti, maggiore precisione, minore copertura
* **Abbassamento** $k$ — più nomi corrispondenti, minore precisione, maggiore copertura

Un punto di funzionamento ([Punto operativo](https://scikit-learn.org/stable/auto_examples/model_selection/plot_precision_recall.html)) rappresenta la coppia specifica (Copertura, Precisione) alla soglia da voi scelta — ossia il punto della curva in cui decidete di operare.

**Risultato:**

<Frame caption="Precision and coverage as a function of confidence threshold. Operating point at 0.60 marked.">
  <img src="https://mintcdn.com/creditbenchmark/mmxvP-jd6tVp2TN0/images/api/matching/precision_coverage.png?fit=max&auto=format&n=mmxvP-jd6tVp2TN0&q=85&s=5638ca36cccf01993ae8d47ca15a9051" alt="Precision and coverage vs. confidence threshold" style={{ width:"100%" }} width="1555" height="835" data-path="images/api/matching/precision_coverage.png" />
</Frame>

Nel punto operativo $\hat{p} = 0.60$A tale punto di funzionamento, la precisione è pari al {precisione} e la copertura è pari al {copertura}. Due terzi dei nomi ottengono una corrispondenza ad alta affidabilità; il restante terzo, collocandosi al di sotto della soglia, richiede un’ulteriore revisione.
