Truth Perception Dataset (TPD) — dati anonimi su come le persone riconoscono il vero dal falso

Il Truth Perception Dataset raccoglie come le persone giudicano affermazioni vere o false: cosa hanno votato, con quanta sicurezza, e se hanno indovinato. È il dato che manca a chi lavora su disinformazione, fiducia e calibrazione dei modelli — non le opinioni dichiarate, ma le decisioni prese.

Cosa contiene

Ogni riga è un giudizio: l'affermazione (vera o falsa), la categoria fra 7 (lavoro, famiglia, relazione, salute, soldi, viaggio, passato), la lingua fra 5 (it, en, de, es, fr), il voto, la confidenza dichiarata e l'esito.

Da qui si ricavano le misure che interessano davvero: quanto una popolazione è calibrata (dice 80% ed è giusta l'80% delle volte), quali categorie ingannano di più, come cambia la percezione fra lingue diverse.

Come è anonimizzato

Il dataset è anonimo: k-anonimato con soglia k=5 (i gruppi troppo piccoli vengono soppressi), rumore a privacy differenziale sugli aggregati, pseudonimizzazione con sale diverso per ogni export e sostituzione sintetica dei valori residui.

Non viene fornita alcuna chiave di re-identificazione, e il contratto di licenza vieta di tentarla o di collegare il dataset ad altre fonti per ottenerla. Ogni export riporta la propria scorecard di privacy negli header della risposta.

Come si integra

API REST con chiave: export in CSV, JSONL, Parquet, filtri per finestra temporale, categoria e lingua, ripresa incrementale con cursore. Versione corrente v1, con politica di dismissione dichiarata e preavviso minimo di 180 giorni.

Le chiavi si emettono dal portale e si governano: ambiti (solo metadati o anche export), scadenza, allowlist di indirizzi IP, rotazione con periodo di grazia. Quote orarie per piano: TRIAL 5 richieste/ora, STARTER 20 richieste/ora, GROWTH 60 richieste/ora, ENTERPRISE 1000 richieste/ora.

Chi lo usa

Gruppi di ricerca su disinformazione e psicologia della fiducia; team che addestrano o valutano modelli linguistici e hanno bisogno di riferimenti umani sulla percezione del vero; prodotti che misurano la calibrazione delle proprie previsioni.

Licenza, privacy e livelli di servizio

La licenza commerciale del dataset e l'informativa privacy del portale sono consultabili senza registrarsi. Il dataset non contiene dati personali degli utenti dell'applicazione; l'informativa riguarda i dati dell'organizzazione licenziataria.

Livelli di servizio dichiarati: disponibilità 99,5% mensile sulle rotte di export e metadati, prima risposta al supporto entro due giorni lavorativi, comunicazione degli incidenti entro 24 ore.