Skip to main content

· 5 min de lectura · Revisado por el equipo editorial de DNA Info Lab

El archivo de datos en bruto de 23andMe explicado: formato, columnas y límites

¿Qué es el archivo de datos en bruto de 23andMe? Un archivo de texto separado por tabuladores de unas 650.000 filas con cuatro columnas — rsid, cromosoma, posición y genotipo. Registra ~0,02% de tu genoma en posiciones elegidas. Abajo: qué significa cada campo, la versión del genoma, los no-calls y los límites.

Qué es el archivo realmente

Al descargar tus datos de 23andMe obtienes un .txt comprimido. Descomprimido, es texto plano: una cabecera de líneas de comentario que empiezan por #, y luego una fila por cada posición genética que midió el chip. Un archivo típico tiene unas 650.000 filas y pesa pocos megabytes — porque guarda letras, no el genoma entero.

Las cuatro columnas

rsidcromosomaposicióngenotipo
rs49882352136608646AG
rs60251169519049TT
rs4293581945411941CT
  • rsid — el ID de referencia de la variante en dbSNP (p. ej. rs429358). Algunas filas usan un ID interno con prefijo i para sondas propias de 23andMe.
  • cromosoma — del 1 al 22, más X, Y y MT (mitocondrial).
  • posición — la coordenada de par de bases en ese cromosoma, en la versión del genoma del archivo (ver abajo).
  • genotipo — las dos letras (alelos) que llevas en esa posición, una de cada progenitor, p. ej. AG.

Versión del genoma: GRCh37 / hg19

Los números de posición son relativos a una referencia. Los archivos de 23andMe usan GRCh37 (hg19). Esto importa si cruzas posiciones con una base de datos en otra versión (p. ej. GRCh38) — las coordenadas no cuadrarán. Emparejar por rsid evita el problema, por eso la mayoría de herramientas (la nuestra incluida) usan el rsid.

No-calls: -- y 0

No todas las posiciones se leen bien. Cuando el chip no puede determinar un genotipo escribe -- (23andMe) o 0 (AncestryDNA). Una pequeña fracción de no-calls es normal y simplemente hace que esa posición se omita en el análisis.

Por qué no es tu genoma completo

Un microarray genotipa posiciones concretas preseleccionadas — unas 650.000 de los ~3.000 millones de pares de bases del genoma (~0,02%). Esas posiciones se eligen para cubrir las variantes comunes más estudiadas y asociadas a enfermedad, así que el archivo es muy útil para análisis de riesgo y rasgos, pero no contendrá mutaciones raras que no estaban en el chip. Para eso hace falta secuenciación del genoma completo.

Cómo abrirlo

Es solo texto — cualquier editor lo abre, aunque 650.000 filas pueden ir lentas en un procesador de textos. Para interpretarlo de verdad, o buscas rsids concretos a mano en SNPedia/dbSNP, o subes el archivo completo a una herramienta que lo cruce con investigación curada.

Preguntas frecuentes

¿Puedo abrir el archivo en bruto de 23andMe en Excel?

Sí — es texto separado por tabuladores. Pero con ~650.000 filas puede ir lento y Excel puede alterar algunos valores. Un editor de texto plano o una herramienta de análisis es más seguro.

¿Qué versión del genoma usa 23andMe?

GRCh37 (también llamada hg19). Empareja variantes por rsid en vez de por posición para evitar desajustes de versión.

¿Qué significan -- o 0 en la columna de genotipo?

Son no-calls: el chip no pudo leer esa posición con fiabilidad. Se omiten en el análisis y una cantidad pequeña es normal.

¿El archivo en bruto es mi ADN completo?

No. Cubre ~0,02% de tu genoma — las posiciones preseleccionadas del chip. Basta para análisis de riesgo y rasgos de variantes comunes, pero no para mutaciones raras.

Mira qué contiene tu archivo

Sube tu archivo en bruto de 23andMe, AncestryDNA o MyHeritage y obtén un informe gratuito que lee por ti cada posición relevante.

Artículos relacionados

Este artículo tiene fines exclusivamente educativos y no constituye consejo médico, diagnóstico ni tratamiento. Consulta siempre a un profesional sanitario para decisiones sobre tu salud.