HelixCore · OmniOta Validación · resumen v1.4.0 · 2026-08-10
Motor de producción minimap2-lca/3.0.0 · árbol de trabajo 61a0bb7c Método, salvedades y fuentes completas en el dossier de ocho secciones
Módulo 01 · Ingesta metagenómica

Validación de OmniOta en cuatro páginas

Exactitud de clasificación taxonómica sobre cuatro materiales de composición conocida, tres químicas de nanoporo y dos competidores ejecutados con la misma referencia. Cifras del motor de producción; cada una con la química y el año del material que la produjo.

99,08 %
exactitud a género sobre comunidad certificada por el fabricante
97,26 %
exactitud a especie en la química vigente, R10.4.1 de 2023
8/8
miembros recuperados hasta el 74,23 % de identidad, donde el competidor no devuelve nada
22.514
genomas de referencia, los mismos que se dieron al competidor
Ámbito de la medición
Métrica Lecturas correctas sobre lecturas clasificadas, la definición literal de los autores de GAIA. Se publica también nuestra cobertura, que ellos no publicaron.
Rango Género en la comparación con la literatura, porque es el rango que Brown analizó. Especie donde el material la sostiene, con su denominador a la vista.
Plataformas Nanoporo: MinION, GridION y PromethION, químicas R7.3/R9, R9.4.1 y R10.4.1. Illumina: sin medir por esta vía.
Referencia Catálogo procariota de RefSeq, 22.514 genomas. Los resultados no se extienden a hongos ni virus, y las levaduras de los estándares quedan fuera del cómputo por esa razón.
Código El banco importa la misma función de clasificación que corre en el producto. Guardas automáticas de test comparan el texto publicado contra el JSON de la corrida.

1 · Tabla maestra: cada cifra con su química y su año

Un benchmark se cita a trozos. La exactitud a especie sobre Brown 2017 mide una química de 2015 con identidad mediana del 74 % —a esa calidad de dato ninguna herramienta del mercado sostiene una especie—, no la herramienta. Cada fila declara el material que produjo el número.

Material Año · química Identidad Género Especie Lecturas a especie
Brown et al. 2017 · 7 conjuntos MinION 2015 · R7.3/R9 74,23 % 97,70 % 37,4 % 99
ZymoBIOMICS D6300 · GridION 2019 · R9.4.1 88,77 % 99,08 % 97,24 % 15.549
ZymoBIOMICS D6300 · PromethION 2019 · R9.4.1 88,77 % 99,00 % 97,14 % 14.731
Zymo HMW mock · PRJNA934154 2023 · R10.4.1 97,30 % 98,53 % 97,26 % 28.774
Serie degradada desde D6300 2019 degradado 74,23 % 99,40 % no se afirma —

A mejor química, más lecturas resueltas a especie con la misma exactitud: 99 en 2015, 15.549 en 2019, 28.774 en 2023, siempre por encima del 97 % de acierto. Cada exactitud está condicionada a las lecturas que el sistema sí clasifica —el 89,5 % en 2023 frente al 53,7 % en 2019—, y por eso la columna de lecturas viaja al lado del porcentaje en las cinco filas.

2 · Brown 2017: el terreno de la competencia

Brown et al. (2017) secuenciaron con MinION cultivos puros y mezclas de composición declarada y publicaron la exactitud de MG-RAST, Kraken y One Codex. Paytuví-Gallart et al. (2019) reprocesaron esos mismos ficheros con GAIA y añadieron su columna. Es el único punto donde una cifra de OmniOta puede ponerse al lado de la de un competidor sobre verdad conocida. Los nueve conjuntos se descargaron del ENA y el recuento de lecturas coincide exactamente con el publicado en los nueve.

Conjunto OmniOta GAIA Kraken One Codex MG-RAST
Ecoli · E. coli 95,00 % 100,0 % 99,5 % 98,7 % 74,7 %
Pfluor · P. fluorescens 94,64 % 85,83 % 84,6 % 84,2 % 84,9 %
Maeru · M. aeruginosa 96,58 % 96,39 % 85,8 % 95,1 % 53,1 %
Selong · S. elongatus 100,00 % 100,0 % 98,1 % 97,6 % 87,9 %
Equal (5) c 97,70 % 93,47 % 97,6 % 87,4 % 65,0 %
Equal (6) c 100,00 % 98,94 % 98,0 % 98,7 % 85,9 %
Rare (6) c 100,00 % 100,0 % 99,1 % 98,7 % 92,9 %
Media (7) 97,70 % 96,37 % 94,67 % 94,34 % 77,77 %
Agregada · 896/932 96,1 % IC 95 % de Wilson [94,7 % – 97,2 %] — el intervalo contiene el 96,37 % de GAIA

c cota superior: en una mezcla se cuenta como acierto toda lectura asignada a cualquiera de los cuatro miembros. Afecta por igual a las cinco herramientas, cuyas cifras publicadas se calcularon sobre esas mismas mezclas. Las columnas de GAIA, Kraken, One Codex y MG-RAST son las publicadas por sus autores: GAIA es un servicio cerrado con base propietaria y no se ha ejecutado, de modo que una parte de la diferencia es atribuible a la referencia y no al método.

Qué dice la estadística sobre esta ventaja

La media más alta de las cinco herramientas es la nuestra, y la mayor ventaja se da en el conjunto más difícil —P. fluorescens, donde las cuatro publicadas quedan entre el 84,2 % y el 85,8 %—. La media de siete porcentajes da el mismo peso a un conjunto de 27 lecturas que a uno de 317; se calcula así porque es lo que hizo GAIA y sin ello no habría comparación, y junto a ella se publica la agregada, que es la estadísticamente correcta. Con este volumen de datos la ventaja media no alcanza significación, y así se declara.

+1,33 pp
diferencia media sobre GAIA, desviación típica 4,27 pp
t = 0,823
de Student pareada, 6 gl · crítico bilateral al 5 %: 2,447
p = 0,375
prueba de los signos, 4 a favor de 5 pares no empatados
Nomenclatura declarada

Shigella se cuenta como Escherichia: es polifilética dentro de E. coli y su ANI supera el umbral de especie; el nombre se conserva por relevancia clínica, no taxonómica (ISO 13136:2012). Afecta a 36 de las 78 lecturas del conjunto Ecoli — sin la fusión la cifra sería 39,7 % en lugar de 94,6 %, y por eso se declara. Son exactamente dos casos en todo el catálogo, se derivan de los complejos que el producto ya muestra al usuario y no tocan los nombres de especie.

El conjunto más exigente

El conjunto staggered es HM-783D de BEI Resources: veinte especies certificadas entre el 0,03 % y el 41,25 %, con congéneres que hay que separar —S. aureus de S. epidermidis, tres Streptococcus— y miembros tres órdenes por debajo del dominante. 96,86 % a género, 185 de 191 lecturas, cota superior. Brown publicó un 93 % sobre este mismo material. No entra en la media porque GAIA no publicó cifra para él.

3 · Composición certificada, invariancia y química vigente

ZymoBIOMICS D6300 · certificado por el fabricante

Diez especies con composición certificada en la ficha del fabricante —ocho bacterias al 12 % de ADN genómico y dos levaduras al 2 %—, secuenciadas por Nicholls, Quick, Tang y Loman (2019) con GridION y PromethION. 50.000 lecturas medidas por plataforma.

GridION PromethION
exactitud a género 99,08 % 99,00 %
exactitud a especie 97,24 % 97,14 %
lecturas a especie 15.549 14.731
mayor falso positivo 0,17 % 0,21 %
L1 entre plataformas 0,0181 · esperada por muestreo (p95) 0,0257 · 0 taxones divergentes → invariante

La composición es invariante entre GridION y PromethION: las diferencias por género van de 0,05 a 0,43 puntos y la divergencia global es estadísticamente indistinguible del muestreo. Lo que no se repite son los artefactos de baja abundancia —Macrococcus, que no es miembro, aparece con 23 lecturas en una plataforma y 5 en la otra—: la composición se repite, las trazas no, y eso fija qué peso dar a un taxón sostenido por veinte lecturas. Exactitud en cota superior por ser mezcla; las lecturas proceden del prefijo del run, que sobre-representa las primeras horas de la celda, y así se dice.

R10.4.1 · la química vigente

Un producto de 2026 evaluado sobre química de 2019 es una objeción legítima, y no se contesta con argumentos sino midiendo. La identidad se mide alineando contra los genomas del estándar, no se toma de la hoja de especificaciones.

Material Química Identidad
Brown · 2015 R7.3 / R9 74,23 %
Nicholls · 2019 R9.4.1 88,77 %
Zymo HMW · 2023 R10.4.1 (sup) 97,30 %

Sobre esa química el motor clasifica el 89,5 % de las lecturas a género con un 98,53 % de exactitud y el 57,5 % a especie con un 97,26 %, hallando 7 de 7 miembros en los dos rangos. Frente al material de 2019, las lecturas resueltas a especie pasan del 31,1 % al 57,5 % con la misma exactitud: casi el doble de resolución sin perder acierto.

La calidad del dato se elige hoy

El mismo run publicado con los tres basecallers de ONT —mismas señales, mismo poro, mismo día— da fast 89,80 %, hac 96,16 % y sup 97,30 %. Un run de 2023 con basecalling fast queda en la misma identidad que el material de 2019 con el mejor basecalling. La identidad baja no es una condición histórica superada: es un estado en el que se entra hoy, por una casilla de configuración, por ADN degradado térmicamente, por una matriz grasa o por una celda al final de su vida. fast consume 7,5 de los ~15 puntos de margen que separan el material moderno del punto donde un método de k-meros exactos deja de devolver resultado.

4 · El límite del dato y los competidores en igualdad de referencia

Curva de rotura · una sola variable libre

Entre Brown 2017 y Zymo D6300 cambia todo a la vez: año, química, secuenciador, comunidad, laboratorio e identidad. Con dos puntos que difieren en seis variables no está justificado atribuir un colapso a una de ellas. El experimento toma el mismo fichero de Zymo y le inyecta error a tasas crecientes con semilla fija: todo lo demás es idéntico por construcción. Sólo sustituciones, ni indels —que son más destructivos para un k-mero exacto—, de modo que el escenario es conservador para el competidor.

Identidad Miembros OmniOta Taxones sylph
88,77 %8/88
87,17 %8/87
84,91 %8/86
82,65 %8/80
79,68 %8/80
76,84 %8/80
74,23 %8/80

El nivel más degradado aterriza en el 74,23 %, la identidad mediana de Brown 2017: no hacía falta un dataset de 2015, basta degradar el de 2019. Los ocho organismos se recuperan en todos los niveles, incluido el más severo, donde el competidor no devuelve una sola línea. Es el resultado que importa para una muestra real de alimentación: ADN fragmentado por el procesado, matriz grasa, extracción difícil. La exactitud a género sube al degradar (99,07 → 99,40 %) y eso no es un mérito sino sesgo de selección: quedan las lecturas fáciles, y las clasificadas caen del 53,7 % al 36,6 %. En química moderna sylph funciona bien: detecta 7 de 7 miembros en los tres basecallers, incluido fast.

sylph con los mismos 22.514 genomas

Contra GAIA sólo caben sus cifras publicadas: servicio cerrado, base propietaria. Con sylph sí se puede igualar la referencia, y se ha hecho genoma a genoma sobre D6300 certificado. Las dos herramientas encuentran la comunidad completa y cada una es más fuerte en un eje distinto.

OmniOta sylph
exactitud por lectura 99,18 % no aplica
miembros hallados 8/8 8/8
taxones emitidos 61 8
peso de los sobrantes 0,82 % —

Por lectura OmniOta es muy preciso, y esa es la cifra que gobierna una tabla de abundancias y todo lo que se calcula encima. Por taxón nombrado sylph decide mejor: modela la cobertura del genoma con estadística de k-meros y exige presencia real antes de nombrar, mientras nosotros nombramos cualquier taxón que reciba una asignación. El criterio en desarrollo es una evidencia mínima para nombrar, no sólo para asignar: la misma doctrina de Wilson que el producto ya aplica a la confianza por taxón, llevada a la decisión de publicar.

Abundancia: contar lecturas no es contar ADN

Sobre el estándar HMW, equimolar al 14,3 %, contar lecturas daba a Salmonella el 47,1 % y a Bacillus el 3,2 %. La abundancia es cobertura media —bases alineadas sobre tamaño de genoma—, y con esa métrica la divergencia L1 baja de 0,852 a 0,411: medir masa de ADN reduce el error a la mitad. MetaPhlAn 4.2.6, que no comparte nada con nuestro método —marcadores UniRef frente a genomas completos—, coincide con nosotros en 2,14 puntos de media y en el orden de los tres mayores: el material secuenciado no es equimolar, y eso queda establecido por dos vías independientes. Sobre lo que sí compite, OmniOta queda un 18 % más cerca de la composición certificada (L1 0,411 frente a 0,501). MetaPhlAn detecta S. cerevisiae y nosotros no, porque nuestra referencia es bacteriana.

Sello de la medición
versión1.4.0
fecha de la medición2026-08-10
motorminimap2-lca/3.0.0
árbol de trabajo61a0bb7c
referencia22.514 genomas · 35,1 GB
competidores aquísylph · MetaPhlAn 4.2.6

Kraken2/Bracken no está medido: su base con estos mismos 22.514 genomas pediría del orden de 170 GB de RAM, medidos, así que se publica el motivo en lugar de darle una base recortada.

Fuentes
  1. Brown BL et al. (2017) GigaScience 6(3):1-10. 10.1093/gigascience/gix007
  2. Paytuví A et al. (2019) GAIA. bioRxiv 804690. 10.1101/804690
  3. Nicholls SM et al. (2019) GigaScience 8(5):giz043. 10.1093/gigascience/giz043
  4. Shaw J, Yu YW (2024) sylph. Nature Biotechnology. 10.1038/s41587-024-02412-y
  5. Richter M, Rosselló-Móra R (2009) PNAS 106(45):19126-31 · Jain C et al. (2018) Nat Commun 9:5114 · Altman & Bland (1995) BMJ 311:485 · ISO 13136:2012
  6. Material: ENA PRJEB8672, PRJEB8716, ERR3152364/65 · NCBI PRJNA934154 · ficha ZymoBIOMICS D6300 · BEI Resources HM-783D
HelixCore · BIOTECNO.org · Vitoria-Gasteiz
Método, salvedades y fuentes completas en el dossier de ocho secciones
© 2026 BIOTECNO Research Group
Aviso legalPrivacidadCookies