Perché l’intelligenza artificiale non riesce a leggere i PDF?

Nonostante gli enormi progressi della tecnologia per l'AI quello dei PDF rimane uno scoglio difficile da valicare

2 min.

Perché l’intelligenza artificiale non riesce a leggere i PDF?

L’intelligenza artificiale sa scrivere poesie, generare immagini iperrealistiche e persino aiutare a diagnosticare malattie, ma c’è una cosa che ancora non riesce a fare bene: leggere un PDF. Nonostante i progressi degli ultimi anni, i modelli più avanzati continuano a inciampare su uno dei formati di file più diffusi al mondo. Secondo Edwin Chen, CEO di Surge, azienda specializzata nella etichettatura intelligente dei dati, si tratta di uno dei “fallimenti poco glamour” dell’AI, che ne limita l’utilità pratica in ambiti come la ricerca, la burocrazia e l’analisi dati.

I problemi sono molteplici. In primo luogo i modelli confondono note a piè di pagina con il testo principale, inventano contenuti inesistenti e perdendosi in tabelle e layout complessi. “Chiedere a un’AI di estrarre dati da un PDF spesso significa ottenere un riassunto impreciso, non un’informazione affidabile”, spiega Chen. La situazione è talmente nota che il ricercatore Pierre-Carl Langlais ha ironizzato: “Il giorno in cui l’AI risolverà l’analisi dei PDF, saremo vicini all’intelligenza artificiale generale”.

Secondo la piattaforma software Astera, il 68% dei dati aziendali non viene utilizzato proprio perché bloccato in PDF di difficile interpretazione automatica. Un paradosso, se si pensa che ogni anno vengono creati trilioni di documenti in questo formato, dai report finanziari alle cartelle cliniche. Le soluzioni esistenti, come i modelli di visione linguistica addestrati su centinaia di migliaia di PDF, funzionano solo con documenti molto puliti e risultano troppo costose per essere applicate su larga scala. “La vera sfida non è la tecnologia, ma la varietà dei formati: ogni PDF è un mondo a sé”, sottolinea un rapporto di Parseur, azienda specializzata in estrazione dati.

In questo contesto c’è però chi prova a correre ai ripari. Startup come Reducto e strumenti come AlgoDocs stanno sviluppando algoritmi sempre più sofisticati, combinando OCR (riconoscimento ottico dei caratteri) e AI per interpretare tabelle, grafici e testi scansionati. Tuttavia, anche le soluzioni più avanzate faticano a garantire un’accuratezza superiore al 97%, un limite inaccettabile per settori come la finanza o la sanità, dove l’errore può costare caro.


Articoli simili

Ultime news


GPT-5.6 Luna arriva sul piano gratuito di ChatGPT per tutti gli utenti

La scelta è importante perché Luna non è un modello…

GPT-5.6 Luna arriva sul piano gratuito di ChatGPT per tutti gli utenti
Gravitee lancia Agent Accountability: un framework aperto per governare gli agenti AI

Gravitee ha pubblicato Agent Accountability, un framework aperto con cinque…

Gravitee lancia Agent Accountability: un framework aperto per governare gli agenti AI
Costi AI aziendali giù del 67%: il multi-modello cambia tutto

Le spese enterprise per le API di intelligenza artificiale sono…

Costi AI aziendali giù del 67%: il multi-modello cambia tutto
Perché l’algoritmo non potrà licenziarti

L'Italia ha regolato una situazione che iniziava ad allarmare più…

Perché l’algoritmo non potrà licenziarti
Il modello Kimi K3 è evaso da un ambiente di test di sicurezza

La scoperta è stata resa nota dalla società di ricerca…

Il modello Kimi K3 è evaso da un ambiente di test di sicurezza

In Evidenza


New York contro i data center (e altre notizie generative) | Weekly AI

Weekly AI è la newsletter settimanale di AI news sulle…

New York contro i data center (e altre notizie generative) | Weekly AI
Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo

Lo riferisce un sondaggio Ipsos BVA condotto su 3.800 ragazzi…

Più del 50% dei giovani europei usa l’AI per cercare supporto emotivo
Intelligenza artificiale: prepararsi al 2026 | Il report di AI News

Il nuovo report di AI News per non farsi sorprendere…

Intelligenza artificiale: prepararsi al 2026 | Il report di AI News
AI, bolla o non bolla? Il parere degli esperti non è unanime

Ne abbiamo intervistati cinque per unire i puntini

AI, bolla o non bolla? Il parere degli esperti non è unanime
Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

"Se potessi tornare indietro, eliminerei l'espressione 'intelligenza artificiale', la chiamerei…

Luciano Floridi: “L’intelligenza artificiale non è intelligente”, la nostra intervista | AI Talks #20

Privacy policy| Cookie policy| Cookie setting| © 2026