Approfondimenti
Cosa dovrebbe significare una confidenza del 90 per cento
Un punteggio di confidenza è utile solo se è calibrato. Come definiamo la calibrazione, come la verifichiamo sul registro delle decisioni e come diventa una soglia.
Pubblicato · 3 min di lettura
Ogni decisione di Sixth Sense porta con sé un numero tra 0 e 100. Quel numero stabilisce se il robot agisce o chiede. Quindi conta cosa significa.
Una definizione che puoi verificare
Un punteggio di confidenza è calibrato quando corrisponde al tasso di esiti. Prendi tutte le decisioni a cui il modello ha dato 90. Se il punteggio è calibrato, circa nove su dieci erano corrette. Prendi quelle a 60: circa sei su dieci. Il punteggio è una previsione, e una previsione è buona quando si avvera tanto spesso quanto dichiara.
È una definizione che puoi verificare con dati che hai già. Nulla dipende da come funziona il modello al suo interno.
Perché un punteggio non calibrato è peggio di nessun punteggio
Un modello non calibrato può essere accurato e restare pericoloso. Immagina un modello che dà 95 a ogni articolo e ha ragione quattro volte su cinque. Una soglia a 85 lascia passare tutto, compreso quell’uno su cinque che sbaglia. Il numero sembrava preciso e non significava nulla.
L’errore opposto è più silenzioso. Un modello che non supera mai 70 manda ogni articolo all’operatore. Nessuno si fa male, e nessuno aveva bisogno del robot.
Una soglia funziona solo su un numero che significa qualcosa. Per questo trattiamo la calibrazione come un requisito, non come una proprietà gradita.
Come la verifichiamo
Il registro di audit conserva, per ogni decisione, la confidenza e cosa è successo dopo: il robot ha agito e nessuno ha obiettato, oppure un operatore ha confermato, corretto o bloccato. Quel registro è un insieme di dati per la calibrazione.
Raggruppiamo le decisioni per punteggio, in fasce di cinque o dieci punti, e confrontiamo il punteggio di ogni fascia con la quota delle sue decisioni risultate corrette. Su un grafico è un diagramma di affidabilità. A parole: la fascia 90 dovrebbe stare vicino a 90, la fascia 70 vicino a 70. Dove una fascia sta sotto il suo punteggio, il modello lì è troppo sicuro. Dove sta sopra, è troppo prudente.
La calibrazione si verifica per sito e per compito. Un modello ben calibrato sugli articoli di uno stabilimento può essere fuori su quelli di un altro, perché gli articoli sono diversi. La ricalibrazione è un piccolo aggiustamento sopra il modello, non un nuovo addestramento, e si ripete quando gli articoli cambiano.
Dalla calibrazione alla soglia
Una volta che il punteggio è calibrato, la soglia diventa una domanda semplice: quanti errori ogni cento sei disposto a lasciar passare su questo compito prima che una persona guardi? Una soglia a 90 ne accetta circa dieci. Una soglia a 98 ne accetta circa due e manda più casi all’operatore.
La risposta giusta dipende da quanto costa un errore. Scartare una fiala buona costa una fiala. Spedire un cartone danneggiato costa un cliente. I compiti con errori economici hanno una soglia più bassa. Quelli con errori costosi hanno una soglia più alta e, spesso, una regola rigida che blocca l’azione del tutto sotto un minimo.
Cosa non promettiamo
La calibrazione deriva. Nuovi prodotti, nuova illuminazione, un nuovo fornitore: ognuno sposta gli articoli che il modello vede. Verifichiamo la calibrazione di continuo sul registro, non una volta all’installazione, e trattiamo una fascia che deriva come un segnale per guardare gli articoli, non solo il modello.
Il punteggio è onesto finché qualcuno continua a controllare che lo sia.