HelixCore · OmniOta Validierung · Kurzfassung v1.4.0 · 2026-08-10
Produktions-Engine minimap2-lca/3.0.0 · Arbeitsbaum 61a0bb7c Methode, Vorbehalte und vollständige Quellen im Dossier mit acht Abschnitten
Modul 01 · Metagenomische Datenaufnahme

Die Validierung von OmniOta auf vier Seiten

Genauigkeit der taxonomischen Klassifikation an vier Materialien bekannter Zusammensetzung, drei Nanoporen-Chemien und zwei Wettbewerbern, die mit derselben Referenz ausgeführt wurden. Zahlen aus der Produktions-Engine; jede mit der Chemie und dem Jahr des erzeugenden Materials.

99,08 %
Genauigkeit auf Genusebene an einer vom Hersteller zertifizierten Gemeinschaft
97,26 %
Genauigkeit auf Artebene mit der aktuellen Chemie, R10.4.1 von 2023
8/8
Mitglieder bis hinunter zu 74,23 % Identität wiedergefunden, wo der Wettbewerber nichts zurückgibt
22.514
Referenzgenome, dieselben, die dem Wettbewerber übergeben wurden
Geltungsbereich der Messung
Metrik Korrekte Reads geteilt durch klassifizierte Reads, die wörtliche Definition der GAIA-Autoren. Zusätzlich wird unsere Abdeckung veröffentlicht, was sie nicht getan haben.
Rang Genus im Vergleich mit der Literatur, weil das der von Brown analysierte Rang ist. Art dort, wo das Material sie trägt, mit dem Nenner sichtbar.
Plattformen Nanopore: MinION, GridION und PromethION, Chemien R7.3/R9, R9.4.1 und R10.4.1. Illumina: auf diesem Weg nicht gemessen.
Referenz Prokaryotenkatalog von RefSeq, 22.514 Genome. Die Ergebnisse erstrecken sich nicht auf Pilze oder Viren, und die Hefen der Standards bleiben aus diesem Grund außerhalb der Zählung.
Code Der Prüfstand importiert genau die Klassifikationsfunktion, die im Produkt läuft. Automatische Test-Wächter prüfen den veröffentlichten Text gegen das JSON des Laufs.

1 · Haupttabelle: jede Zahl mit ihrer Chemie und ihrem Jahr

Ein Benchmark wird in Stücken zitiert. Die Artgenauigkeit auf Brown 2017 misst eine Chemie von 2015 mit einer medianen Identität von 74 % — bei dieser Datenqualität trägt kein Werkzeug am Markt eine Artaussage — und nicht das Werkzeug. Jede Zeile nennt das Material, das die Zahl erzeugt hat.

Material Jahr · Chemie Identität Genus Art Reads auf Artebene
Brown et al. 2017 · 7 MinION-Datensätze 2015 · R7.3/R9 74,23 % 97,70 % 37,4 % 99
ZymoBIOMICS D6300 · GridION 2019 · R9.4.1 88,77 % 99,08 % 97,24 % 15.549
ZymoBIOMICS D6300 · PromethION 2019 · R9.4.1 88,77 % 99,00 % 97,14 % 14.731
Zymo HMW mock · PRJNA934154 2023 · R10.4.1 97,30 % 98,53 % 97,26 % 28.774
Degradierte Serie aus D6300 2019 degradiert 74,23 % 99,40 % nicht behauptet —

Je besser die Chemie, desto mehr Reads werden bei gleicher Genauigkeit auf Artebene aufgelöst: 99 im Jahr 2015, 15.549 im Jahr 2019, 28.774 im Jahr 2023, stets über 97 % Trefferquote. Jede Genauigkeit ist auf die Reads bedingt, die das System tatsächlich klassifiziert — 89,5 % im Jahr 2023 gegenüber 53,7 % im Jahr 2019 — weshalb die Read-Spalte in allen fünf Zeilen neben dem Prozentwert steht.

2 · Brown 2017: das Terrain des Wettbewerbers

Brown et al. (2017) sequenzierten mit MinION Reinkulturen und Mischungen erklärter Zusammensetzung und veröffentlichten die Genauigkeit von MG-RAST, Kraken und One Codex. Paytuví-Gallart et al. (2019) verarbeiteten genau diese Dateien mit GAIA neu und fügten ihre Spalte hinzu. Das ist der einzige Punkt, an dem eine OmniOta-Zahl neben der eines Wettbewerbers auf bekannter Wahrheit stehen kann. Die neun Datensätze wurden aus dem ENA geladen und die Read-Zahlen stimmen in allen neun exakt mit den veröffentlichten überein.

Datensatz OmniOta GAIA Kraken One Codex MG-RAST
Ecoli · E. coli 95,00 % 100,0 % 99,5 % 98,7 % 74,7 %
Pfluor · P. fluorescens 94,64 % 85,83 % 84,6 % 84,2 % 84,9 %
Maeru · M. aeruginosa 96,58 % 96,39 % 85,8 % 95,1 % 53,1 %
Selong · S. elongatus 100,00 % 100,0 % 98,1 % 97,6 % 87,9 %
Equal (5) c 97,70 % 93,47 % 97,6 % 87,4 % 65,0 %
Equal (6) c 100,00 % 98,94 % 98,0 % 98,7 % 85,9 %
Rare (6) c 100,00 % 100,0 % 99,1 % 98,7 % 92,9 %
Mittelwert (7) 97,70 % 96,37 % 94,67 % 94,34 % 77,77 %
Aggregiert · 896/932 96,1 % Wilson-95-%-KI [94,7 % – 97,2 %] — das Intervall enthält die 96,37 % von GAIA

c Obergrenze: in einer Mischung zählt jeder Read, der einem der vier Mitglieder zugewiesen wird, als Treffer. Das betrifft alle fünf Werkzeuge gleichermaßen, deren veröffentlichte Zahlen an genau diesen Mischungen berechnet wurden. Die Spalten von GAIA, Kraken, One Codex und MG-RAST sind die von ihren Autoren veröffentlichten: GAIA ist ein geschlossener Dienst mit proprietärer Datenbank und wurde nicht ausgeführt, sodass ein Teil der Differenz der Referenz und nicht der Methode zuzuschreiben ist.

Was die Statistik zu diesem Vorsprung sagt

Der höchste Mittelwert der fünf Werkzeuge ist der unsere, und der größte Vorsprung tritt beim schwierigsten Datensatz auf —P. fluorescens, wo die vier veröffentlichten Werkzeuge zwischen 84,2 % und 85,8 % liegen. Ein Mittelwert aus sieben Prozentwerten gibt einem Datensatz mit 27 Reads dasselbe Gewicht wie einem mit 317; er wird so berechnet, weil GAIA es so gemacht hat und es ohne ihn keinen Vergleich gäbe, und daneben wird der aggregierte veröffentlicht, der statistisch korrekte. Bei diesem Datenvolumen erreicht der mittlere Vorsprung keine Signifikanz, und das wird so erklärt.

+1,33 pp
mittlere Differenz gegenüber GAIA, Standardabweichung 4,27 pp
t = 0,823
gepaarter Student-t, 6 FG · zweiseitiger kritischer Wert bei 5 %: 2,447
p = 0,375
Vorzeichentest, 4 zugunsten von 5 nicht gleichstehenden Paaren
Erklärte Nomenklatur

Shigella zählt als Escherichia: sie ist polyphyletisch innerhalb von E. coli und ihre ANI überschreitet die Artschwelle; der Name wird aus klinischer, nicht taxonomischer Relevanz beibehalten (ISO 13136:2012). Betroffen sind 36 der 78 Reads des Ecoli-Datensatzes — ohne die Zusammenführung lautete die Zahl 39,7 % statt 94,6 %, und deshalb wird sie erklärt. Es sind genau zwei Fälle im gesamten Katalog, sie leiten sich aus den Komplexen ab, die das Produkt dem Nutzer bereits zeigt, und sie lassen Artnamen unberührt.

Der anspruchsvollste Datensatz

Der Datensatz staggered ist HM-783D von BEI Resources: zwanzig zertifizierte Arten zwischen 0,03 % und 41,25 %, mit zu trennenden Kongeneren —S. aureus de S. epidermidis, drei Streptococcus— und Mitgliedern drei Größenordnungen unter dem dominanten. 96,86 % auf Genusebene, 185 von 191 Reads, Obergrenze. Brown veröffentlichte 93 % auf genau diesem Material. Er geht nicht in den Mittelwert ein, weil GAIA dafür keine Zahl veröffentlicht hat.

3 · Zertifizierte Zusammensetzung, Invarianz und aktuelle Chemie

ZymoBIOMICS D6300 · vom Hersteller zertifiziert

Zehn Arten mit im Herstellerdatenblatt zertifizierter Zusammensetzung — acht Bakterien mit 12 % genomischer DNA und zwei Hefen mit 2 % — sequenziert von Nicholls, Quick, Tang und Loman (2019) auf GridION und PromethION. 50.000 gemessene Reads pro Plattform.

GridION PromethION
Genauigkeit auf Genusebene 99,08 % 99,00 %
Genauigkeit auf Artebene 97,24 % 97,14 %
Reads auf Artebene 15.549 14.731
größter Falschpositiver 0,17 % 0,21 %
L1 zwischen Plattformen 0,0181 · durch Stichprobe erwartet (p95) 0,0257 · 0 divergente Taxa → invariant

Die Zusammensetzung ist zwischen GridION und PromethION invariant: die Unterschiede je Genus reichen von 0,05 bis 0,43 Punkte, und die Gesamtdivergenz ist statistisch nicht von der Stichprobenziehung unterscheidbar. Was sich nicht wiederholt, sind die Artefakte geringer Abundanz —Macrococcus, das kein Mitglied ist, erscheint mit 23 Reads auf einer Plattform und 5 auf der anderen. Die Zusammensetzung wiederholt sich, die Spuren nicht, und das legt fest, welches Gewicht einem von zwanzig Reads getragenen Taxon zukommt. Genauigkeit als Obergrenze, da es eine Mischung ist; die Reads stammen aus dem Präfix des Laufs, das die ersten Stunden der Zelle überrepräsentiert, und das wird gesagt.

R10.4.1 · die aktuelle Chemie

Ein Produkt von 2026, bewertet auf der Chemie von 2019, ist ein berechtigter Einwand, und er wird nicht mit Argumenten, sondern mit Messungen beantwortet. Die Identität wird durch Alignment gegen die Genome des Standards gemessen; sie wird nicht dem Datenblatt entnommen.

Material Chemie Identität
Brown · 2015 R7.3 / R9 74,23 %
Nicholls · 2019 R9.4.1 88,77 %
Zymo HMW · 2023 R10.4.1 (sup) 97,30 %

Auf dieser Chemie klassifiziert die Engine 89,5 % der Reads auf Genusebene mit 98,53 % Genauigkeit und 57,5 % auf Artebene mit 97,26 %, wobei 7 von 7 Mitgliedern auf beiden Rängen gefunden werden. Gegenüber dem Material von 2019 steigen die auf Artebene aufgelösten Reads von 31,1 % auf 57,5 % bei gleicher Genauigkeit: fast die doppelte Auflösung ohne Verlust an Treffsicherheit.

Die Datenqualität wird heute gewählt

Derselbe Lauf, veröffentlicht mit allen drei Basecallern von ONT — gleiche Signale, gleiche Pore, gleicher Tag — ergibt fast 89,80 %, hac 96,16 % y sup 97,30 %. Ein Lauf von 2023 mit Basecalling fast landet bei derselben Identität wie das Material von 2019 mit dem besten Basecalling. Niedrige Identität ist kein überwundener historischer Zustand: es ist ein Zustand, in den man heute gerät, durch ein Konfigurationskästchen, durch thermisch degradierte DNA, durch eine fetthaltige Matrix oder durch eine Zelle am Ende ihres Lebens. fast verbraucht 7,5 der ~15 Margenpunkte, die das moderne Material von dem Punkt trennen, an dem ein Verfahren mit exakten k-meren kein Ergebnis mehr zurückgibt.

4 · Die Grenze der Daten und die Wettbewerber bei gleicher Referenz

Bruchkurve · eine einzige freie Variable

Zwischen Brown 2017 und Zymo D6300 ändert sich alles gleichzeitig: Jahr, Chemie, Sequenzierer, Gemeinschaft, Labor und Identität. Bei zwei Punkten, die sich in sechs Variablen unterscheiden, ist es nicht gerechtfertigt, einen Einbruch einer von ihnen zuzuschreiben. Das Experiment nimmt dieselbe Datei von Zymo und injiziert Fehler in steigenden Raten mit festem Startwert: alles Übrige ist konstruktionsbedingt identisch. Nur Substitutionen, keine Indels — die für ein exaktes k-mer zerstörerischer sind — sodass das Szenario konservativ zugunsten des Wettbewerbers.

Identität Mitglieder OmniOta Taxa sylph
88,77 %8/88
87,17 %8/87
84,91 %8/86
82,65 %8/80
79,68 %8/80
76,84 %8/80
74,23 %8/80

Die stärkste Degradationsstufe landet bei 74,23 %, der medianen Identität von Brown 2017: ein Datensatz von 2015 war nicht nötig, es genügt, den von 2019 zu degradieren. Alle acht Organismen werden auf jeder Stufe wiedergefunden, auch auf der härtesten, wo der Wettbewerber keine einzige Zeile zurückgibt. Das ist das Ergebnis, das für eine echte Lebensmittelprobe zählt: durch die Verarbeitung fragmentierte DNA, fetthaltige Matrix, schwierige Extraktion. Die Genusgenauigkeit steigt mit der Degradation (99,07 → 99,40 %) und das ist kein Verdienst, sondern Selektionsbias: es bleiben die leichten Reads übrig, und die klassifizierten fallen von 53,7 % auf 36,6 %. Auf moderner Chemie funktioniert sylph gut: es erkennt 7 von 7 Mitgliedern mit allen drei Basecallern, auch mit fast.

sylph mit denselben 22.514 Genomen

Gegen GAIA stehen nur seine veröffentlichten Zahlen zur Verfügung: geschlossener Dienst, proprietäre Datenbank. Mit sylph lässt sich die Referenz sehr wohl gleichsetzen, und das ist Genom für Genom auf zertifiziertem D6300 geschehen. Beide Werkzeuge finden die vollständige Gemeinschaft, und jedes ist auf einer anderen Achse stärker.

OmniOta sylph
Genauigkeit pro Read 99,18 % nicht anwendbar
gefundene Mitglieder 8/8 8/8
ausgegebene Taxa 61 8
Gewicht der Überzähligen 0,82 % —

Pro Read ist OmniOta sehr präzise, und das ist die Zahl, die eine Abundanztabelle und alles darauf Berechnete bestimmt. Pro benanntem Taxon entscheidet sylph besser: es modelliert die Genomabdeckung mit k-mer-Statistik und verlangt tatsächliche Präsenz, bevor es benennt, während wir jedes Taxon benennen, das eine Zuweisung erhält. Das in Entwicklung befindliche Kriterium ist eine Mindestevidenz zum Benennen, nicht bloß zum Zuweisen: dieselbe Wilson-Doktrin, die das Produkt bereits auf die Konfidenz je Taxon anwendet, weitergeführt bis zur Entscheidung über die Veröffentlichung.

Abundanz: Reads zu zählen ist nicht DNA zu zählen

Auf dem HMW-Standard, äquimolar bei 14,3 %, ergab das Zählen von Reads für Salmonella el 47,1 % y a Bacillus 3,2 %. Abundanz ist die mittlere Abdeckung — alignierte Basen über Genomgröße — und mit dieser Metrik fällt die L1-Divergenz von 0,852 auf 0,411: DNA-Masse zu messen halbiert den Fehler. MetaPhlAn 4.2.6, das nichts mit unserer Methode teilt — UniRef-Marker gegen vollständige Genome — stimmt mit uns im Mittel auf 2,14 Punkte und in der Reihenfolge der drei größten überein: das sequenzierte Material ist nicht äquimolar, und das ist auf zwei unabhängigen Wegen belegt. In dem, was tatsächlich im Wettbewerb steht, liegt OmniOta 18 % näher an der zertifizierten Zusammensetzung (L1 0,411 gegenüber 0,501). MetaPhlAn erkennt S. cerevisiae und wir nicht, weil unsere Referenz bakteriell ist.

Stempel der Messung
Version1.4.0
Datum der Messung2026-08-10
Engineminimap2-lca/3.0.0
Arbeitsbaum61a0bb7c
Referenz22.514 Genome · 35,1 GB
Wettbewerber hiersylph · MetaPhlAn 4.2.6

Kraken2/Bracken ist nicht gemessen: seine Datenbank mit genau diesen 22.514 Genomen würde in der Größenordnung von 170 GB RAM verlangen, gemessen, daher wird der Grund veröffentlicht, anstatt ihm eine beschnittene Datenbank zu geben.

Quellen
  1. Brown BL et al. (2017) GigaScience 6(3):1-10. 10.1093/gigascience/gix007
  2. Paytuví A et al. (2019) GAIA. bioRxiv 804690. 10.1101/804690
  3. Nicholls SM et al. (2019) GigaScience 8(5):giz043. 10.1093/gigascience/giz043
  4. Shaw J, Yu YW (2024) sylph. Nature Biotechnology. 10.1038/s41587-024-02412-y
  5. Richter M, Rosselló-Móra R (2009) PNAS 106(45):19126-31 · Jain C et al. (2018) Nat Commun 9:5114 · Altman & Bland (1995) BMJ 311:485 · ISO 13136:2012
  6. Material: ENA PRJEB8672, PRJEB8716, ERR3152364/65 · NCBI PRJNA934154 · Datenblatt ZymoBIOMICS D6300 · BEI Resources HM-783D
HelixCore · BIOTECNO.org · Vitoria-Gasteiz
Methode, Vorbehalte und vollständige Quellen im Dossier mit acht Abschnitten
© 2026 BIOTECNO Research Group
ImpressumDatenschutzCookies