· 5 min de lectura · Revisado por el equipo editorial de DNA Info Lab
El archivo de datos en bruto de 23andMe explicado: formato, columnas y límites
¿Qué es el archivo de datos en bruto de 23andMe? Un archivo de texto separado por tabuladores de unas 650.000 filas con cuatro columnas — rsid, cromosoma, posición y genotipo. Registra ~0,02% de tu genoma en posiciones elegidas. Abajo: qué significa cada campo, la versión del genoma, los no-calls y los límites.
Qué es el archivo realmente
Al descargar tus datos de 23andMe obtienes un .txt comprimido. Descomprimido, es texto plano: una cabecera de líneas de comentario que empiezan por #, y luego una fila por cada posición genética que midió el chip. Un archivo típico tiene unas 650.000 filas y pesa pocos megabytes — porque guarda letras, no el genoma entero.
Las cuatro columnas
| rsid | cromosoma | posición | genotipo |
|---|---|---|---|
| rs4988235 | 2 | 136608646 | AG |
| rs6025 | 1 | 169519049 | TT |
| rs429358 | 19 | 45411941 | CT |
- rsid — el ID de referencia de la variante en dbSNP (p. ej. rs429358). Algunas filas usan un ID interno con prefijo
ipara sondas propias de 23andMe. - cromosoma — del 1 al 22, más X, Y y MT (mitocondrial).
- posición — la coordenada de par de bases en ese cromosoma, en la versión del genoma del archivo (ver abajo).
- genotipo — las dos letras (alelos) que llevas en esa posición, una de cada progenitor, p. ej.
AG.
Versión del genoma: GRCh37 / hg19
Los números de posición son relativos a una referencia. Los archivos de 23andMe usan GRCh37 (hg19). Esto importa si cruzas posiciones con una base de datos en otra versión (p. ej. GRCh38) — las coordenadas no cuadrarán. Emparejar por rsid evita el problema, por eso la mayoría de herramientas (la nuestra incluida) usan el rsid.
No-calls: -- y 0
No todas las posiciones se leen bien. Cuando el chip no puede determinar un genotipo escribe -- (23andMe) o 0 (AncestryDNA). Una pequeña fracción de no-calls es normal y simplemente hace que esa posición se omita en el análisis.
Por qué no es tu genoma completo
Un microarray genotipa posiciones concretas preseleccionadas — unas 650.000 de los ~3.000 millones de pares de bases del genoma (~0,02%). Esas posiciones se eligen para cubrir las variantes comunes más estudiadas y asociadas a enfermedad, así que el archivo es muy útil para análisis de riesgo y rasgos, pero no contendrá mutaciones raras que no estaban en el chip. Para eso hace falta secuenciación del genoma completo.
Cómo abrirlo
Es solo texto — cualquier editor lo abre, aunque 650.000 filas pueden ir lentas en un procesador de textos. Para interpretarlo de verdad, o buscas rsids concretos a mano en SNPedia/dbSNP, o subes el archivo completo a una herramienta que lo cruce con investigación curada.
Preguntas frecuentes
¿Puedo abrir el archivo en bruto de 23andMe en Excel?▼
Sí — es texto separado por tabuladores. Pero con ~650.000 filas puede ir lento y Excel puede alterar algunos valores. Un editor de texto plano o una herramienta de análisis es más seguro.
¿Qué versión del genoma usa 23andMe?▼
GRCh37 (también llamada hg19). Empareja variantes por rsid en vez de por posición para evitar desajustes de versión.
¿Qué significan -- o 0 en la columna de genotipo?▼
Son no-calls: el chip no pudo leer esa posición con fiabilidad. Se omiten en el análisis y una cantidad pequeña es normal.
¿El archivo en bruto es mi ADN completo?▼
No. Cubre ~0,02% de tu genoma — las posiciones preseleccionadas del chip. Basta para análisis de riesgo y rasgos de variantes comunes, pero no para mutaciones raras.
Mira qué contiene tu archivo
Sube tu archivo en bruto de 23andMe, AncestryDNA o MyHeritage y obtén un informe gratuito que lee por ti cada posición relevante.
Artículos relacionados
Este artículo tiene fines exclusivamente educativos y no constituye consejo médico, diagnóstico ni tratamiento. Consulta siempre a un profesional sanitario para decisiones sobre tu salud.