HelixCore · OmniOta Validation · résumé v1.4.0 · 2026-08-10
Moteur de production minimap2-lca/3.0.0 · arbre de travail 61a0bb7c Méthode, réserves et sources complètes dans le dossier en huit sections
Module 01 · Ingestion métagénomique

La validation d'OmniOta en quatre pages

Exactitude de classification taxonomique sur quatre matériels de composition connue, trois chimies de nanopore et deux concurrents exécutés avec la même référence. Chiffres du moteur de production ; chacun avec la chimie et l'année du matériel qui l'a produit.

99,08 %
exactitude au genre sur une communauté certifiée par le fabricant
97,26 %
exactitude à l'espèce sur la chimie actuelle, R10.4.1 de 2023
8/8
membres récupérés jusqu'à 74,23 % d'identité, là où le concurrent ne renvoie rien
22 514
génomes de référence, les mêmes que ceux donnés au concurrent
Périmètre de la mesure
Métrique Lectures correctes sur lectures classées, la définition littérale des auteurs de GAIA. Notre couverture est également publiée, ce qu'ils n'ont pas fait.
Rang Le genre pour la comparaison avec la littérature, parce que c'est le rang analysé par Brown. L'espèce là où le matériel la soutient, avec son dénominateur en évidence.
Plateformes Nanopore : MinION, GridION et PromethION, chimies R7.3/R9, R9.4.1 et R10.4.1. Illumina : non mesuré par cette voie.
Référence Catalogue procaryote de RefSeq, 22 514 génomes. Les résultats ne s'étendent ni aux champignons ni aux virus, et les levures des standards restent hors décompte pour cette raison.
Code Le banc importe la fonction de classification même qui tourne dans le produit. Des garde-fous automatiques de test comparent le texte publié au JSON du run.

1 · Tableau maître : chaque chiffre avec sa chimie et son année

Un benchmark se cite par morceaux. L'exactitude à l'espèce sur Brown 2017 mesure une chimie de 2015 dont l'identité médiane est de 74 % — à cette qualité de donnée aucun outil du marché ne soutient une espèce — et non l'outil. Chaque ligne déclare le matériel qui a produit le nombre.

Matériel Année · chimie Identité Genre Espèce Lectures à l'espèce
Brown et al. 2017 · 7 jeux MinION 2015 · R7.3/R9 74,23 % 97,70 % 37,4 % 99
ZymoBIOMICS D6300 · GridION 2019 · R9.4.1 88,77 % 99,08 % 97,24 % 15 549
ZymoBIOMICS D6300 · PromethION 2019 · R9.4.1 88,77 % 99,00 % 97,14 % 14 731
Zymo HMW mock · PRJNA934154 2023 · R10.4.1 97,30 % 98,53 % 97,26 % 28.774
Série dégradée depuis D6300 2019 dégradé 74,23 % 99,40 % non affirmée —

Meilleure la chimie, plus de lectures résolues à l'espèce à exactitude égale : 99 en 2015, 15 549 en 2019, 28 774 en 2023, toujours au-dessus de 97 % de réussite. Chaque exactitude est conditionnée aux lectures que le système classe effectivement — 89,5 % en 2023 contre 53,7 % en 2019 — d'où la colonne des lectures à côté du pourcentage sur les cinq lignes.

2 · Brown 2017 : le terrain du concurrent

Brown et al. (2017) ont séquencé sur MinION des cultures pures et des mélanges de composition déclarée et publié l'exactitude de MG-RAST, Kraken et One Codex. Paytuví-Gallart et al. (2019) ont retraité ces mêmes fichiers avec GAIA et ajouté leur colonne. C'est le seul point où un chiffre d'OmniOta peut être placé à côté de celui d'un concurrent sur vérité connue. Les neuf jeux ont été téléchargés depuis l'ENA et le décompte des lectures coïncide exactement avec celui publié dans les neuf.

Jeu OmniOta GAIA Kraken One Codex MG-RAST
Ecoli · E. coli 95,00 % 100,0 % 99,5 % 98,7 % 74,7 %
Pfluor · P. fluorescens 94,64 % 85,83 % 84,6 % 84,2 % 84,9 %
Maeru · M. aeruginosa 96,58 % 96,39 % 85,8 % 95,1 % 53,1 %
Selong · S. elongatus 100,00 % 100,0 % 98,1 % 97,6 % 87,9 %
Equal (5) c 97,70 % 93,47 % 97,6 % 87,4 % 65,0 %
Equal (6) c 100,00 % 98,94 % 98,0 % 98,7 % 85,9 %
Rare (6) c 100,00 % 100,0 % 99,1 % 98,7 % 92,9 %
Moyenne (7) 97,70 % 96,37 % 94,67 % 94,34 % 77,77 %
Agrégée · 896/932 96,1 % IC 95 % de Wilson [94,7 % – 97,2 %] — l'intervalle contient les 96,37 % de GAIA

c borne supérieure : dans un mélange, toute lecture attribuée à l'un quelconque des quatre membres compte comme juste. Cela affecte également les cinq outils, dont les chiffres publiés ont été calculés sur ces mêmes mélanges. Les colonnes GAIA, Kraken, One Codex et MG-RAST sont celles publiées par leurs auteurs : GAIA est un service fermé à base propriétaire et n'a pas été exécuté, de sorte qu'une partie de la différence est imputable à la référence et non à la méthode.

Ce que dit la statistique sur cet avantage

La moyenne la plus élevée des cinq outils est la nôtre, et le plus grand avantage se produit sur le jeu le plus difficile —P. fluorescens, où les quatre outils publiés se situent entre 84,2 % et 85,8 %. Une moyenne de sept pourcentages donne le même poids à un jeu de 27 lectures qu'à un jeu de 317 ; elle est calculée ainsi parce que c'est ce qu'a fait GAIA et que sans cela il n'y aurait pas de comparaison, et l'agrégée — la statistiquement correcte — est publiée à côté. À ce volume de données l'avantage moyen n'atteint pas la significativité, et c'est déclaré comme tel.

+1,33 pp
différence moyenne sur GAIA, écart-type 4,27 pp
t = 0,823
de Student appariée, 6 ddl · valeur critique bilatérale à 5 % : 2,447
p = 0,375
test des signes, 4 en faveur sur 5 paires non ex æquo
Nomenclature déclarée

Shigella compte comme Escherichia : elle est polyphylétique au sein d' E. coli et son ANI dépasse le seuil d'espèce ; le nom est conservé pour sa pertinence clinique, non taxonomique (ISO 13136:2012). Cela concerne 36 des 78 lectures du jeu Ecoli — sans la fusion le chiffre serait de 39,7 % au lieu de 94,6 %, et c'est pourquoi il est déclaré. Il y a exactement deux cas dans tout le catalogue, ils dérivent des complexes que le produit montre déjà à l'utilisateur et ils ne touchent pas aux noms d'espèce.

Le jeu le plus exigeant

Le jeu staggered est HM-783D de BEI Resources : vingt espèces certifiées entre 0,03 % et 41,25 %, avec des congénères à séparer —S. aureus de S. epidermidis, trois Streptococcus— et des membres trois ordres sous le dominant. 96,86 % au genre, 185 des 191 lectures, borne supérieure. Brown a publié 93 % sur ce même matériel. Il n'entre pas dans la moyenne car GAIA n'a publié aucun chiffre pour lui.

3 · Composition certifiée, invariance et chimie actuelle

ZymoBIOMICS D6300 · certifié par le fabricant

Dix espèces à composition certifiée dans la fiche du fabricant — huit bactéries à 12 % d'ADN génomique et deux levures à 2 % — séquencées par Nicholls, Quick, Tang et Loman (2019) sur GridION et PromethION. 50 000 lectures mesurées par plateforme.

GridION PromethION
exactitude au genre 99,08 % 99,00 %
exactitude à l'espèce 97,24 % 97,14 %
lectures à l'espèce 15 549 14 731
plus grand faux positif 0,17 % 0,21 %
L1 entre plateformes 0,0181 · attendue par échantillonnage (p95) 0,0257 · 0 taxon divergent → invariante

La composition est invariante entre GridION et PromethION : les écarts par genre vont de 0,05 à 0,43 point et la divergence globale est statistiquement indiscernable de l'échantillonnage. Ce qui ne se répète pas, ce sont les artefacts de faible abondance —Macrococcus, qui n'est pas membre, apparaît avec 23 lectures sur une plateforme et 5 sur l'autre. La composition se répète, les traces non, et cela fixe le poids à accorder à un taxon soutenu par vingt lectures. Exactitude en borne supérieure car il s'agit d'un mélange ; les lectures proviennent du préfixe du run, qui surreprésente les premières heures de la cellule, et cela est dit.

R10.4.1 · la chimie actuelle

Un produit de 2026 évalué sur la chimie de 2019 est une objection légitime, et elle ne se réfute pas par des arguments mais par la mesure. L'identité est mesurée par alignement contre les génomes du standard ; elle n'est pas reprise de la fiche technique.

Matériel Chimie Identité
Brown · 2015 R7.3 / R9 74,23 %
Nicholls · 2019 R9.4.1 88,77 %
Zymo HMW · 2023 R10.4.1 (sup) 97,30 %

Sur cette chimie le moteur classe 89,5 % des lectures au genre avec 98,53 % d'exactitude et 57,5 % à l'espèce avec 97,26 %, en trouvant 7 membres sur 7 aux deux rangs. Face au matériel de 2019, les lectures résolues à l'espèce passent de 31,1 % à 57,5 % à exactitude égale : presque le double de résolution sans perte de justesse.

La qualité de la donnée se choisit aujourd'hui

Le même run publié avec les trois basecallers d'ONT — mêmes signaux, même pore, même jour — donne fast 89,80 %, hac 96,16 % y sup 97,30 %. Un run de 2023 avec basecalling fast se retrouve à la même identité que le matériel de 2019 avec le meilleur basecalling. L'identité basse n'est pas une condition historique dépassée : c'est un état où l'on entre aujourd'hui, par une case de configuration, par de l'ADN dégradé thermiquement, par une matrice grasse ou par une cellule en fin de vie. fast consomme 7,5 des ~15 points de marge qui séparent le matériel moderne du point où une méthode de k-mers exacts cesse de renvoyer un résultat.

4 · La limite de la donnée et les concurrents à référence égale

Courbe de rupture · une seule variable libre

Entre Brown 2017 et Zymo D6300 tout change à la fois : année, chimie, séquenceur, communauté, laboratoire et identité. Avec deux points qui diffèrent par six variables, il n'est pas justifié d'attribuer un effondrement à l'une d'elles. L'expérience prend le même fichier de Zymo et y injecte de l'erreur à des taux croissants avec une graine fixe : tout le reste est identique par construction. Substitutions seulement, pas d'indels — plus destructeurs pour un k-mer exact — de sorte que le scénario est conservatrice en faveur du concurrent.

Identité Membres OmniOta Taxons sylph
88,77 %8/88
87,17 %8/87
84,91 %8/86
82,65 %8/80
79,68 %8/80
76,84 %8/80
74,23 %8/80

Le niveau le plus dégradé atterrit à 74,23 %, l'identité médiane de Brown 2017 : aucun jeu de 2015 n'était nécessaire, dégrader celui de 2019 suffit. Les huit organismes sont récupérés à tous les niveaux, y compris le plus sévère, où le concurrent ne renvoie pas une seule ligne. C'est le résultat qui compte pour un échantillon alimentaire réel : ADN fragmenté par le procédé, matrice grasse, extraction difficile. L'exactitude au genre monte à mesure que le matériel se dégrade (99,07 → 99,40 %) et cela n'est pas un mérite mais un biais de sélection : ce sont les lectures faciles qui restent, et les classées chutent de 53,7 % à 36,6 %. Sur la chimie moderne sylph fonctionne bien : il détecte 7 membres sur 7 avec les trois basecallers, y compris fast.

sylph avec les mêmes 22 514 génomes

Face à GAIA, seuls ses chiffres publiés sont disponibles : service fermé, base propriétaire. Avec sylph on peut effectivement égaliser la référence, et cela a été fait génome par génome sur D6300 certifié. Les deux outils trouvent la communauté complète et chacun est plus fort sur un axe différent.

OmniOta sylph
exactitude par lecture 99,18 % sans objet
membres trouvés 8/8 8/8
taxons émis 61 8
poids des excédentaires 0,82 % —

Par lecture, OmniOta est très précis, et c'est le chiffre qui gouverne une table d'abondances et tout ce qui se calcule par-dessus. Par taxon nommé, sylph décide mieux : il modélise la couverture du génome par statistique de k-mers et exige une présence réelle avant de nommer, alors que nous nommons tout taxon qui reçoit une attribution. Le critère en développement est une évidence minimale pour nommer, et non seulement pour attribuer : la même doctrine de Wilson que le produit applique déjà à la confiance par taxon, portée jusqu'à la décision de publier.

Abondance : compter des lectures n'est pas compter de l'ADN

Sur le standard HMW, équimolaire à 14,3 %, compter les lectures donnait à Salmonella el 47,1 % y a Bacillus 3,2 %. L'abondance est la couverture moyenne — bases alignées sur taille du génome — et avec cette métrique la divergence L1 chute de 0,852 à 0,411: mesurer la masse d'ADN réduit l'erreur de moitié. MetaPhlAn 4.2.6, qui ne partage rien avec notre méthode — marqueurs UniRef contre génomes complets — concorde avec nous à 2,14 points en moyenne et sur l'ordre des trois plus grands : le matériel séquencé n'est pas équimolaire, et cela est établi par deux voies indépendantes. Sur ce qui est réellement en compétition, OmniOta se place 18 % plus près de la composition certifiée (L1 0,411 contre 0,501). MetaPhlAn détecte S. cerevisiae et nous non, car notre référence est bactérienne.

Sceau de la mesure
version1.4.0
date de la mesure2026-08-10
moteurminimap2-lca/3.0.0
arbre de travail61a0bb7c
référence22 514 génomes · 35,1 Go
concurrents icisylph · MetaPhlAn 4.2.6

Kraken2/Bracken n'est pas mesuré : sa base avec ces mêmes 22 514 génomes exigerait de l'ordre de 170 Go de RAM, mesurés, si bien qu'on publie la raison plutôt que de lui donner une base tronquée.

Sources
  1. Brown BL et al. (2017) GigaScience 6(3):1-10. 10.1093/gigascience/gix007
  2. Paytuví A et al. (2019) GAIA. bioRxiv 804690. 10.1101/804690
  3. Nicholls SM et al. (2019) GigaScience 8(5):giz043. 10.1093/gigascience/giz043
  4. Shaw J, Yu YW (2024) sylph. Nature Biotechnology. 10.1038/s41587-024-02412-y
  5. Richter M, Rosselló-Móra R (2009) PNAS 106(45):19126-31 · Jain C et al. (2018) Nat Commun 9:5114 · Altman & Bland (1995) BMJ 311:485 · ISO 13136:2012
  6. Matériel : ENA PRJEB8672, PRJEB8716, ERR3152364/65 · NCBI PRJNA934154 · fiche ZymoBIOMICS D6300 · BEI Resources HM-783D
HelixCore · BIOTECNO.org · Vitoria-Gasteiz
Méthode, réserves et sources complètes dans le dossier en huit sections
© 2026 BIOTECNO Research Group
Mentions légalesConfidentialitéCookies