Machine-Assisted Source Classification in Model Reviews
Una rassegna di modello vale quanto le sue fonti. L’intelligenza artificiale può etichettare documenti, date e tipi di affermazione. Non può decidere se un paragrafo è un fatto, un’intenzione o una metafora di vendita.
I flussi di tecnologia finanziaria applicati alla ricerca rischiano due eccessi speculari: il rifiuto totale degli strumenti, o la fiducia nel riassunto automatico. Questo saggio descrive un uso intermedio: la classificazione assistita delle fonti, con un registro visibile e una revisione umana obbligatoria.
Perché classificare prima di sintetizzare
Sintetizzare un corpus misto — comunicato, intervista, slide, nota di metodo, articolo di terzi — produce un testo liscio e spesso falso. Classificare prima significa sapere, per ogni affermazione che entrerò in rassegna, da quale tipo di documento viene e in quale data. La data conta: i modelli di business nelle imprese in avvio cambiano racconto più in fretta dei bilanci, quando i bilanci esistono.
Un riassunto senza registro delle fonti è un pezzo di prosa. Non è una rassegna.
Uno schema minimo di etichette
Un protocollo pratico può usare poche classi:
- dichiarazione dell’impresa (data, supporto);
- dichiarazione di terzi indipendenti (con il grado di indipendenza visibile);
- dato numerico con denominatore;
- dato numerico senza denominatore;
- inferenza del redattore (mai confusa con le precedenti).
Un modello linguistico può proporre queste etichette. Sbaglia spesso sul confine tra intenzione e fatto. Per questo ogni proposta resta in bozza finché un redattore non la conferma o la ribalta.
Allucinazione documentale
L’errore tipico non è inventare un numero spettacolare. È attribuire a un documento una frase che sta in un altro, o che non sta da nessuna parte. Il controllo è banale e non automatizzabile del tutto: aprire la fonte, cercare il passaggio, rifiutare la frase se il passaggio manca.
Cosa non entra nel classificatore
Non etichettiamo “opportunità”, “momentum”, “fit con il portafoglio”. Non colleghiamo fonti a sedi di negoziazione. Non usiamo la classificazione per produrre una lista di acquisto. Lo strumento serve a tenere in ordine il banco, non a chiudere una decisione.
Ogni rassegna pubblica elenca il corpus (titolo, data, tipo) e indica quali passaggi sono inferenze. Se il corpus è troppo magro, la rassegna è più corta, non più inventiva.
Limiti
La classificazione non certifica la veridicità di una fonte. Un comunicato può essere ordinato e inesatto. Il metodo rende visibile il tipo di materiale, non la sua verità.
Chiusura
La tecnologia finanziaria, in questo studio, è un’infrastruttura di annotazione. Resta utile finché qualcuno può dire di no a un’etichetta. Quel “no” è il cuore del mestiere.