Skip to main content

· 5 min di lettura · Revisionato dal team editoriale di DNA Info Lab

Il file di dati grezzi 23andMe spiegato: formato, colonne e limiti

Cos'è il file di dati grezzi 23andMe? Un file di testo separato da tabulazioni di circa 650.000 righe con quattro colonne — rsid, cromosoma, posizione e genotipo. Registra ~0,02% del tuo genoma in posizioni scelte. Sotto: cosa significa ogni campo, la build del genoma, i no-call e i limiti.

Cos'è davvero il file

Scaricando i tuoi dati da 23andMe ottieni un .txt compresso. Decompresso è testo semplice: una breve intestazione di righe di commento che iniziano con #, poi una riga per ogni posizione genetica misurata dal chip. Un file tipico ha circa 650.000 righe e pesa pochi megabyte — perché memorizza lettere, non l'intero genoma.

Le quattro colonne

rsidcromosomaposizionegenotipo
rs49882352136608646AG
rs60251169519049TT
rs4293581945411941CT
  • rsid — l'ID di riferimento della variante in dbSNP (es. rs429358). Alcune righe usano un ID interno con prefisso i per sonde specifiche di 23andMe.
  • cromosoma — da 1 a 22, più X, Y e MT (mitocondriale).
  • posizione — la coordinata in paia di basi su quel cromosoma, nella build del genoma del file (vedi sotto).
  • genotipo — le due lettere (alleli) che porti in quella posizione, una da ciascun genitore, es. AG.

Build del genoma: GRCh37 / hg19

I numeri di posizione sono relativi a un riferimento. I file 23andMe usano GRCh37 (hg19). Conta se incroci le posizioni con un database su una build diversa (es. GRCh38) — le coordinate non coincideranno. Abbinare per rsid evita il problema, ed è per questo che la maggior parte degli strumenti (il nostro incluso) usa l'rsid.

No-call: -- e 0

Non tutte le posizioni si leggono bene. Quando il chip non riesce a determinare un genotipo scrive -- (23andMe) o 0 (AncestryDNA). Una piccola frazione di no-call è normale e fa semplicemente saltare quella posizione nell'analisi.

Perché non è il tuo genoma completo

Un microarray genotipizza posizioni specifiche preselezionate — circa 650.000 dei ~3 miliardi di paia di basi del genoma (~0,02%). Sono scelte per coprire le varianti comuni più studiate e associate a malattie, quindi il file è molto utile per analisi di rischio e tratti, ma non conterrà mutazioni rare non presenti sul chip. Per quelle serve il sequenziamento dell'intero genoma.

Come aprirlo

È solo testo — qualsiasi editor lo apre, anche se 650.000 righe possono essere lente in un word processor. Per interpretarlo davvero, o cerchi singoli rsid a mano su SNPedia/dbSNP, o carichi l'intero file su uno strumento che lo incrocia con ricerca curata.

Domande frequenti

Posso aprire il file grezzo di 23andMe in Excel?

Sì — è testo separato da tabulazioni. Ma con ~650.000 righe può essere lento ed Excel può alterare alcuni valori. Un editor di testo semplice o uno strumento di analisi è più sicuro.

Che build del genoma usa 23andMe?

GRCh37 (chiamata anche hg19). Abbina le varianti per rsid invece che per posizione per evitare disallineamenti di build.

Cosa significano -- o 0 nella colonna del genotipo?

Sono no-call: il chip non ha potuto leggere quella posizione in modo affidabile. Vengono saltati nell'analisi e una piccola quantità è normale.

Il file grezzo è il mio DNA completo?

No. Copre ~0,02% del tuo genoma — le posizioni preselezionate sul chip. Basta per analisi di rischio e tratti di varianti comuni, ma non per mutazioni rare.

Guarda cosa contiene il tuo file

Carica il tuo file grezzo 23andMe, AncestryDNA o MyHeritage e ottieni un report gratuito che legge per te ogni posizione rilevante.

Articoli correlati

Questo articolo ha scopo esclusivamente educativo e non costituisce un parere medico, una diagnosi o un trattamento. Consulta sempre un professionista sanitario per decisioni sulla tua salute.