Pillole

Pillole di informazione digitale

Segnalazioni di articoli su diritti digitali, software libero, open data, didattica, tecno-controllo, privacy, big data, AI, Machine learning...

Il miglior materiale di addestramento per l'intelligenza artificiale è fermo su uno scaffale. La frase è di ISBNdb, il più grande database di libri al mondo e che oggi vende ai laboratori di IA un servizio di acquisizione all'ingrosso di volumi cartacei da scansionare. C'è un sinistro contrappasso: il settore che porta avanti la promessa di digitalizzare la conoscenza umana ora paga per rastrellarla e triturarla, un camion di libri alla volta.

Il dettaglio fondamentale, e che rappresenta il valore dell'operazione, è la data di stampa: un libro pubblicato prima del 2022 precede l'era dei grandi modelli linguistici, quindi non può contenere testo generato da un'IA. Il web aperto è ormai saturo di contenuti sintetici, prodotti dagli stessi modelli, e addestrarsi su quel materiale espone al cosiddetto model collapse.

Quando un modello viene addestrato sull'output di modelli precedenti, le sfumature linguistiche si appiattiscono, gli errori sistematici si sommano e ogni generazione risulta leggermente peggiore di quella prima. Una tiratura cartacea pre-2022 è invece un archivio umano fissato, che nessuno può riscrivere di nascosto a posteriori.

ISBNdb non nasconde che scansionare questi volumi significa quasi sempre distruggerli. Gli operai tagliano il dorso, così le pagine sciolte scorrono nello scanner, più rapido ed economico dell'alternativa delicata. Per questo ISBNdb offre riservatezza ai clienti: NDA rigoroso su ogni incarico, recita il sito, e i nomi dei committenti non vengono mai rivelati.

Si tratta ovviamente di una squisita questione di marketing e immagine: un'azienda di IA che distrugge due milioni di libri non è qualcosa che genera simpatia. Meglio parlare di "preservazione digitale dei libri".

Notizia completa qui

Articolo originale a pagamento su 404media

Approfondimento sul data poisoning qui