· 5 min di lettura · Revisionato dal team editoriale di DNA Info Lab
Il file di dati grezzi 23andMe spiegato: formato, colonne e limiti
Cos'è il file di dati grezzi 23andMe? Un file di testo separato da tabulazioni di circa 650.000 righe con quattro colonne — rsid, cromosoma, posizione e genotipo. Registra ~0,02% del tuo genoma in posizioni scelte. Sotto: cosa significa ogni campo, la build del genoma, i no-call e i limiti.
Cos'è davvero il file
Scaricando i tuoi dati da 23andMe ottieni un .txt compresso. Decompresso è testo semplice: una breve intestazione di righe di commento che iniziano con #, poi una riga per ogni posizione genetica misurata dal chip. Un file tipico ha circa 650.000 righe e pesa pochi megabyte — perché memorizza lettere, non l'intero genoma.
Le quattro colonne
| rsid | cromosoma | posizione | genotipo |
|---|---|---|---|
| rs4988235 | 2 | 136608646 | AG |
| rs6025 | 1 | 169519049 | TT |
| rs429358 | 19 | 45411941 | CT |
- rsid — l'ID di riferimento della variante in dbSNP (es. rs429358). Alcune righe usano un ID interno con prefisso
iper sonde specifiche di 23andMe. - cromosoma — da 1 a 22, più X, Y e MT (mitocondriale).
- posizione — la coordinata in paia di basi su quel cromosoma, nella build del genoma del file (vedi sotto).
- genotipo — le due lettere (alleli) che porti in quella posizione, una da ciascun genitore, es.
AG.
Build del genoma: GRCh37 / hg19
I numeri di posizione sono relativi a un riferimento. I file 23andMe usano GRCh37 (hg19). Conta se incroci le posizioni con un database su una build diversa (es. GRCh38) — le coordinate non coincideranno. Abbinare per rsid evita il problema, ed è per questo che la maggior parte degli strumenti (il nostro incluso) usa l'rsid.
No-call: -- e 0
Non tutte le posizioni si leggono bene. Quando il chip non riesce a determinare un genotipo scrive -- (23andMe) o 0 (AncestryDNA). Una piccola frazione di no-call è normale e fa semplicemente saltare quella posizione nell'analisi.
Perché non è il tuo genoma completo
Un microarray genotipizza posizioni specifiche preselezionate — circa 650.000 dei ~3 miliardi di paia di basi del genoma (~0,02%). Sono scelte per coprire le varianti comuni più studiate e associate a malattie, quindi il file è molto utile per analisi di rischio e tratti, ma non conterrà mutazioni rare non presenti sul chip. Per quelle serve il sequenziamento dell'intero genoma.
Come aprirlo
È solo testo — qualsiasi editor lo apre, anche se 650.000 righe possono essere lente in un word processor. Per interpretarlo davvero, o cerchi singoli rsid a mano su SNPedia/dbSNP, o carichi l'intero file su uno strumento che lo incrocia con ricerca curata.
Domande frequenti
Posso aprire il file grezzo di 23andMe in Excel?▼
Sì — è testo separato da tabulazioni. Ma con ~650.000 righe può essere lento ed Excel può alterare alcuni valori. Un editor di testo semplice o uno strumento di analisi è più sicuro.
Che build del genoma usa 23andMe?▼
GRCh37 (chiamata anche hg19). Abbina le varianti per rsid invece che per posizione per evitare disallineamenti di build.
Cosa significano -- o 0 nella colonna del genotipo?▼
Sono no-call: il chip non ha potuto leggere quella posizione in modo affidabile. Vengono saltati nell'analisi e una piccola quantità è normale.
Il file grezzo è il mio DNA completo?▼
No. Copre ~0,02% del tuo genoma — le posizioni preselezionate sul chip. Basta per analisi di rischio e tratti di varianti comuni, ma non per mutazioni rare.
Guarda cosa contiene il tuo file
Carica il tuo file grezzo 23andMe, AncestryDNA o MyHeritage e ottieni un report gratuito che legge per te ogni posizione rilevante.
Articoli correlati
Questo articolo ha scopo esclusivamente educativo e non costituisce un parere medico, una diagnosi o un trattamento. Consulta sempre un professionista sanitario per decisioni sulla tua salute.