L’idea è grandiosa, il risultato disastroso. Parliamo della possibilità, per ora riservata agli utenti americani, di utilizzare i dati sanitari rilevati da dispositivi come Apple Watch per ottenere uno spaccato del nostro stato di salute.
La dimostrazione che i responsi ottenuti siano da prendere, eufemisticamente parlando, con le molle arriva da un esperimento condotto dal Washington Post, che ha dato in pasto a ChatGPT un’enorme mole di informazioni raccolte dopo dieci anni di utilizzo di Apple Watch.
L’analisi è avvenuta utilizzando ChatGPT Health, una sezione dedicata del motore di Intelligenza Artificiale di OpenAI che consente di collegare non solo Apple Health, ma anche servizi come MyFitnessPal, Weight Watchers, Peloton, AllTrails, Instacart e persino cartelle cliniche e referti di laboratorio, con l’obiettivo dichiarato di offrire risposte sempre più personalizzate.
Un esperimento che mette in allarme
È stato Geoffrey A. Fowler, tech columnist del Washington Post, a fare l’esperimento. La richiesta era relativamente semplice: una valutazione complessiva della salute cardiovascolare nel tempo. La risposta dell’AI è arrivata sotto forma di un giudizio allarmante: un voto F, in pratica gravemente insufficiente.
Preoccupato, Fowler ha sottoposto l’analisi al proprio medico, che ha escluso qualsiasi rischio significativo. Per il giornalista il rischio cardiovascolare sarebbe stato talmente basso da non poter neppure ottenere dalla compagnia assicurativa la copertura di ulteriori esami di routine.
Come se questo non bastasse, a un’ulteriore richiesta di chiarimenti inoltrata a ChatGPT sono giunti voti diversi, tra F, D, C e perfino B, pur partendo dagli stessi dati.
L’intelligenza artificiale ha poi mostrato un comportamento estremamente erratico, ben noto a chi utilizza questi sistemi con frequenza ma che in questo contesto è inaccettabile. Nel corso delle conversazioni dimenticava informazioni già disponibili, come età o valori recenti, mostrando una instabilità incompatibile con qualsiasi uso sanitario.
Stime trattate come certezze
Una spiegazione di questo comportamento ha suscitato la netta riprovazione di figure mediche come Eric Topol, cardiologo dello Scripps Research Institute ed esperto di fama mondiale nel rapporto tra medicina e tecnologie digitali, che ha definito l’analisi dell’AI priva di basi cliniche e fallata alla radice.
Una delle criticità principali riguarda il modo in cui l’AI interpreta i dati provenienti dall’Apple Watch. Gran parte della valutazione negativa si basa su metriche come il VO₂ max stimato, uno degli indicatori più utilizzati per stimare la capacità aerobica, e sulla variabilità della frequenza cardiaca.
Il problema è che il VO₂ max rilevato dall’Apple Watch è una stima algoritmica, non un valore ottenuto tramite test da sforzo controllati. Studi indipendenti hanno dimostrato che queste stime possono risultare significativamente distanti dal valore reale. Nonostante questo, ChatGPT le ha trattate come dati acquisiti e certi, senza incertezze né segnalare limiti metodologici.
Lo stesso vale per la variabilità della frequenza cardiaca, una metrica sensibile al rumore, alle condizioni esterne e ai cambi di dispositivo. Lo stesso Fowler ha notato forti discontinuità nei dati ogni volta che cambiava Apple Watch, ma l’AI ha interpretato quelle variazioni come segnali fisiologici, non come artefatti di misurazione.
AI utile come strumento, non come giudice
L’esperimento non ha portato a una bocciatura totale dell’uso dell’AI in ambito sanitario. ChatGPT Health si è dimostrato utile per visualizzare i dati, creare grafici di lungo periodo e rispondere a domande descrittive. In questo ruolo, l’AI funziona come uno strumento avanzato di analisi.
Il problema nasce quando si tenta di assegnare all’AI il ruolo di consigliere per la salute. Secondo Eric Topol, questo incarico è incompatibile con lo stato attuale dell’Intelligenza Artificiale generalista. Un’AI affidabile in ambito sanitario dovrebbe basarsi su modelli costruiti per la pratica medica, distinguere tra dati solidi e stime approssimative, riconoscere il rumore nei segnali e collegare le informazioni agli esiti clinici reali.
«Se un sistema – dice Topol – non è in grado di valutare correttamente i dati sanitari, allora non dovrebbe nemmeno provare a dare giudizi o voti sulla salute delle persone. Il rischio è spaventarne alcune senza motivo e rassicurarne altre quando invece dovrebbero preoccuparsi».
Interpellata dal Washington Post, OpenAI ha riconosciuto i limiti dell’attuale implementazione, spiegando che ChatGPT Health è ancora in fase di test e che l’accesso tramite lista d’attesa serve a migliorare la coerenza delle risposte prima di un rilascio più ampio.
Il problema è che tutto questo avviene in un contesto regolatorio particolarmente permissivo. Negli Stati Uniti, la Food and Drug Administration ha dichiarato di voler “farsi da parte” per favorire l’innovazione, intervenendo solo in presenza di affermazioni cliniche esplicite. Uno spirito liberista che in campo medico potrebbe avere conseguenze piuttosto gravi.
Strumenti come ChatGPT Health e Claude operano così in una zona grigia: non sono dispositivi medici, non sono sottoposti a validazione preventiva, ma producono valutazioni personalizzate sulla salute delle persone.
Una lezione anche per Apple
Il caso ChatGPT Health arriva in un contesto abbastanza critico per Apple che lavora a progetti come Mulberry, che puntano a integrare l’intelligenza artificiale nell’app Salute per analizzare in modo sempre più approfondito i dati raccolti da Apple Watch, iPhone e AirPods.
L’esperimento mostra quanto il confine sia delicato: applicare un’AI generalista a metriche stimate come VO₂ max e variabilità della frequenza cardiaca può portare a giudizi erratici e privi di basi cliniche.
Se Apple vuole evitare che un’altra idea grandiosa produca risultati disastrosi, dovrà affrontare superare i problemi manifestati da ChatGPT e non sarà facilissimo.













