Exactitud de clasificación taxonómica sobre cuatro materiales de composición conocida, tres químicas de nanoporo y dos competidores ejecutados con la misma referencia. Cifras del motor de producción; cada una con la química y el año del material que la produjo.
| Métrica | Lecturas correctas sobre lecturas clasificadas, la definición literal de los autores de GAIA. Se publica también nuestra cobertura, que ellos no publicaron. |
| Rango | Género en la comparación con la literatura, porque es el rango que Brown analizó. Especie donde el material la sostiene, con su denominador a la vista. |
| Plataformas | Nanoporo: MinION, GridION y PromethION, químicas R7.3/R9, R9.4.1 y R10.4.1. Illumina: sin medir por esta vía. |
| Referencia | Catálogo procariota de RefSeq, 22.514 genomas. Los resultados no se extienden a hongos ni virus, y las levaduras de los estándares quedan fuera del cómputo por esa razón. |
| Código | El banco importa la misma función de clasificación que corre en el producto. Guardas automáticas de test comparan el texto publicado contra el JSON de la corrida. |
Un benchmark se cita a trozos. La exactitud a especie sobre Brown 2017 mide una química de 2015 con identidad mediana del 74 % —a esa calidad de dato ninguna herramienta del mercado sostiene una especie—, no la herramienta. Cada fila declara el material que produjo el número.
| Material | Año · química | Identidad | Género | Especie | Lecturas a especie |
|---|---|---|---|---|---|
| Brown et al. 2017 · 7 conjuntos MinION | 2015 · R7.3/R9 | 74,23 % | 97,70 % | 37,4 % | 99 |
| ZymoBIOMICS D6300 · GridION | 2019 · R9.4.1 | 88,77 % | 99,08 % | 97,24 % | 15.549 |
| ZymoBIOMICS D6300 · PromethION | 2019 · R9.4.1 | 88,77 % | 99,00 % | 97,14 % | 14.731 |
| Zymo HMW mock · PRJNA934154 | 2023 · R10.4.1 | 97,30 % | 98,53 % | 97,26 % | 28.774 |
| Serie degradada desde D6300 | 2019 degradado | 74,23 % | 99,40 % | no se afirma | — |
A mejor química, más lecturas resueltas a especie con la misma exactitud: 99 en 2015, 15.549 en 2019, 28.774 en 2023, siempre por encima del 97 % de acierto. Cada exactitud está condicionada a las lecturas que el sistema sí clasifica —el 89,5 % en 2023 frente al 53,7 % en 2019—, y por eso la columna de lecturas viaja al lado del porcentaje en las cinco filas.
Brown et al. (2017) secuenciaron con MinION cultivos puros y mezclas de composición declarada y publicaron la exactitud de MG-RAST, Kraken y One Codex. Paytuví-Gallart et al. (2019) reprocesaron esos mismos ficheros con GAIA y añadieron su columna. Es el único punto donde una cifra de OmniOta puede ponerse al lado de la de un competidor sobre verdad conocida. Los nueve conjuntos se descargaron del ENA y el recuento de lecturas coincide exactamente con el publicado en los nueve.
| Conjunto | OmniOta | GAIA | Kraken | One Codex | MG-RAST |
|---|---|---|---|---|---|
| Ecoli · E. coli | 95,00 % | 100,0 % | 99,5 % | 98,7 % | 74,7 % |
| Pfluor · P. fluorescens | 94,64 % | 85,83 % | 84,6 % | 84,2 % | 84,9 % |
| Maeru · M. aeruginosa | 96,58 % | 96,39 % | 85,8 % | 95,1 % | 53,1 % |
| Selong · S. elongatus | 100,00 % | 100,0 % | 98,1 % | 97,6 % | 87,9 % |
| Equal (5) c | 97,70 % | 93,47 % | 97,6 % | 87,4 % | 65,0 % |
| Equal (6) c | 100,00 % | 98,94 % | 98,0 % | 98,7 % | 85,9 % |
| Rare (6) c | 100,00 % | 100,0 % | 99,1 % | 98,7 % | 92,9 % |
| Media (7) | 97,70 % | 96,37 % | 94,67 % | 94,34 % | 77,77 % |
| Agregada · 896/932 | 96,1 % | IC 95 % de Wilson [94,7 % – 97,2 %] — el intervalo contiene el 96,37 % de GAIA | |||
c cota superior: en una mezcla se cuenta como acierto toda lectura asignada a cualquiera de los cuatro miembros. Afecta por igual a las cinco herramientas, cuyas cifras publicadas se calcularon sobre esas mismas mezclas. Las columnas de GAIA, Kraken, One Codex y MG-RAST son las publicadas por sus autores: GAIA es un servicio cerrado con base propietaria y no se ha ejecutado, de modo que una parte de la diferencia es atribuible a la referencia y no al método.
La media más alta de las cinco herramientas es la nuestra, y la mayor ventaja se da en el conjunto más difícil —P. fluorescens, donde las cuatro publicadas quedan entre el 84,2 % y el 85,8 %—. La media de siete porcentajes da el mismo peso a un conjunto de 27 lecturas que a uno de 317; se calcula así porque es lo que hizo GAIA y sin ello no habría comparación, y junto a ella se publica la agregada, que es la estadísticamente correcta. Con este volumen de datos la ventaja media no alcanza significación, y así se declara.
Shigella se cuenta como Escherichia: es polifilética dentro de E. coli y su ANI supera el umbral de especie; el nombre se conserva por relevancia clínica, no taxonómica (ISO 13136:2012). Afecta a 36 de las 78 lecturas del conjunto Ecoli — sin la fusión la cifra sería 39,7 % en lugar de 94,6 %, y por eso se declara. Son exactamente dos casos en todo el catálogo, se derivan de los complejos que el producto ya muestra al usuario y no tocan los nombres de especie.
El conjunto staggered es HM-783D de BEI Resources: veinte especies certificadas entre el 0,03 % y el 41,25 %, con congéneres que hay que separar —S. aureus de S. epidermidis, tres Streptococcus— y miembros tres órdenes por debajo del dominante. 96,86 % a género, 185 de 191 lecturas, cota superior. Brown publicó un 93 % sobre este mismo material. No entra en la media porque GAIA no publicó cifra para él.
Diez especies con composición certificada en la ficha del fabricante —ocho bacterias al 12 % de ADN genómico y dos levaduras al 2 %—, secuenciadas por Nicholls, Quick, Tang y Loman (2019) con GridION y PromethION. 50.000 lecturas medidas por plataforma.
| GridION | PromethION | |
|---|---|---|
| exactitud a género | 99,08 % | 99,00 % |
| exactitud a especie | 97,24 % | 97,14 % |
| lecturas a especie | 15.549 | 14.731 |
| mayor falso positivo | 0,17 % | 0,21 % |
| L1 entre plataformas | 0,0181 · esperada por muestreo (p95) 0,0257 · 0 taxones divergentes → invariante | |
La composición es invariante entre GridION y PromethION: las diferencias por género van de 0,05 a 0,43 puntos y la divergencia global es estadísticamente indistinguible del muestreo. Lo que no se repite son los artefactos de baja abundancia —Macrococcus, que no es miembro, aparece con 23 lecturas en una plataforma y 5 en la otra—: la composición se repite, las trazas no, y eso fija qué peso dar a un taxón sostenido por veinte lecturas. Exactitud en cota superior por ser mezcla; las lecturas proceden del prefijo del run, que sobre-representa las primeras horas de la celda, y así se dice.
Un producto de 2026 evaluado sobre química de 2019 es una objeción legítima, y no se contesta con argumentos sino midiendo. La identidad se mide alineando contra los genomas del estándar, no se toma de la hoja de especificaciones.
| Material | Química | Identidad |
|---|---|---|
| Brown · 2015 | R7.3 / R9 | 74,23 % |
| Nicholls · 2019 | R9.4.1 | 88,77 % |
| Zymo HMW · 2023 | R10.4.1 (sup) | 97,30 % |
Sobre esa química el motor clasifica el 89,5 % de las lecturas a género con un 98,53 % de exactitud y el 57,5 % a especie con un 97,26 %, hallando 7 de 7 miembros en los dos rangos. Frente al material de 2019, las lecturas resueltas a especie pasan del 31,1 % al 57,5 % con la misma exactitud: casi el doble de resolución sin perder acierto.
El mismo run publicado con los tres basecallers de ONT —mismas señales, mismo poro, mismo día— da fast 89,80 %, hac 96,16 % y sup 97,30 %. Un run de 2023 con basecalling fast queda en la misma identidad que el material de 2019 con el mejor basecalling. La identidad baja no es una condición histórica superada: es un estado en el que se entra hoy, por una casilla de configuración, por ADN degradado térmicamente, por una matriz grasa o por una celda al final de su vida. fast consume 7,5 de los ~15 puntos de margen que separan el material moderno del punto donde un método de k-meros exactos deja de devolver resultado.
Entre Brown 2017 y Zymo D6300 cambia todo a la vez: año, química, secuenciador, comunidad, laboratorio e identidad. Con dos puntos que difieren en seis variables no está justificado atribuir un colapso a una de ellas. El experimento toma el mismo fichero de Zymo y le inyecta error a tasas crecientes con semilla fija: todo lo demás es idéntico por construcción. Sólo sustituciones, ni indels —que son más destructivos para un k-mero exacto—, de modo que el escenario es conservador para el competidor.
| Identidad | Miembros OmniOta | Taxones sylph |
|---|---|---|
| 88,77 % | 8/8 | 8 |
| 87,17 % | 8/8 | 7 |
| 84,91 % | 8/8 | 6 |
| 82,65 % | 8/8 | 0 |
| 79,68 % | 8/8 | 0 |
| 76,84 % | 8/8 | 0 |
| 74,23 % | 8/8 | 0 |
El nivel más degradado aterriza en el 74,23 %, la identidad mediana de Brown 2017: no hacía falta un dataset de 2015, basta degradar el de 2019. Los ocho organismos se recuperan en todos los niveles, incluido el más severo, donde el competidor no devuelve una sola línea. Es el resultado que importa para una muestra real de alimentación: ADN fragmentado por el procesado, matriz grasa, extracción difícil. La exactitud a género sube al degradar (99,07 → 99,40 %) y eso no es un mérito sino sesgo de selección: quedan las lecturas fáciles, y las clasificadas caen del 53,7 % al 36,6 %. En química moderna sylph funciona bien: detecta 7 de 7 miembros en los tres basecallers, incluido fast.
Contra GAIA sólo caben sus cifras publicadas: servicio cerrado, base propietaria. Con sylph sí se puede igualar la referencia, y se ha hecho genoma a genoma sobre D6300 certificado. Las dos herramientas encuentran la comunidad completa y cada una es más fuerte en un eje distinto.
| OmniOta | sylph | |
|---|---|---|
| exactitud por lectura | 99,18 % | no aplica |
| miembros hallados | 8/8 | 8/8 |
| taxones emitidos | 61 | 8 |
| peso de los sobrantes | 0,82 % | — |
Por lectura OmniOta es muy preciso, y esa es la cifra que gobierna una tabla de abundancias y todo lo que se calcula encima. Por taxón nombrado sylph decide mejor: modela la cobertura del genoma con estadística de k-meros y exige presencia real antes de nombrar, mientras nosotros nombramos cualquier taxón que reciba una asignación. El criterio en desarrollo es una evidencia mínima para nombrar, no sólo para asignar: la misma doctrina de Wilson que el producto ya aplica a la confianza por taxón, llevada a la decisión de publicar.
Sobre el estándar HMW, equimolar al 14,3 %, contar lecturas daba a Salmonella el 47,1 % y a Bacillus el 3,2 %. La abundancia es cobertura media —bases alineadas sobre tamaño de genoma—, y con esa métrica la divergencia L1 baja de 0,852 a 0,411: medir masa de ADN reduce el error a la mitad. MetaPhlAn 4.2.6, que no comparte nada con nuestro método —marcadores UniRef frente a genomas completos—, coincide con nosotros en 2,14 puntos de media y en el orden de los tres mayores: el material secuenciado no es equimolar, y eso queda establecido por dos vías independientes. Sobre lo que sí compite, OmniOta queda un 18 % más cerca de la composición certificada (L1 0,411 frente a 0,501). MetaPhlAn detecta S. cerevisiae y nosotros no, porque nuestra referencia es bacteriana.
| versión | 1.4.0 |
| fecha de la medición | 2026-08-10 |
| motor | minimap2-lca/3.0.0 |
| árbol de trabajo | 61a0bb7c |
| referencia | 22.514 genomas · 35,1 GB |
| competidores aquí | sylph · MetaPhlAn 4.2.6 |
Kraken2/Bracken no está medido: su base con estos mismos 22.514 genomas pediría del orden de 170 GB de RAM, medidos, así que se publica el motivo en lugar de darle una base recortada.