Genauigkeit der taxonomischen Klassifikation, gemessen an vier Materialien bekannter Zusammensetzung, drei Nanoporen-Chemien und zwei Wettbewerbern, die mit derselben Referenz ausgeführt wurden. Zahlen aus der Produktions-Engine, nicht aus einer Laborvariante.
Jede Zahl in diesem Dossier ist an Material bekannter Zusammensetzung gemessen, mit der vom Wettbewerber definierten Metrik, und wird zusammen mit der Chemie und dem Jahr des erzeugenden Materials veröffentlicht. Ohne dieses Paar beschreibt die Zahl ein Werkzeug, das nicht existiert: dieselbe Engine löst 99 Reads auf Artebene mit der Chemie von 2015 und 28.774 mit der von 2023.
| Metrik | Korrekte Reads geteilt durch klassifizierte Reads, die wörtliche Definition der GAIA-Autoren. Zusätzlich wird unsere Abdeckung veröffentlicht, was sie nicht getan haben. |
| Rang | Genus im Vergleich mit der Literatur, weil das der von Brown analysierte Rang ist. Art dort, wo das Material sie trägt, mit dem Nenner sichtbar. |
| Plattformen | Nanopore: MinION, GridION und PromethION, Chemien R7.3/R9, R9.4.1 und R10.4.1. Illumina: auf diesem Weg nicht gemessen. |
| Referenz | Prokaryotenkatalog von RefSeq, 22.514 Genome. Die Ergebnisse erstrecken sich nicht auf Pilze oder Viren, und die beiden Hefen der Standards bleiben aus diesem Grund außerhalb der Zählung. |
| Code | Der Prüfstand importiert genau die Klassifikationsfunktion, die im Produkt läuft, Stempel minimap2-lca/3.0.0. Automatische Test-Wächter fixieren jede methodische Entscheidung dieses Dokuments. |
Dokument abgeleitet aus der kanonischen Dokumentation des Repositoriums: BENCHMARK_OMNIOTA_vs_GAIA_BROWN2017.md v1.4.0, BANCO_ZYMO_D6300_INVARIANCIA.md, QUIMICA_ACTUAL_R1041.md und CURVA_DE_ROTURA_IDENTIDAD.md. Keine Zahl wurde in diesem Dokument berechnet: alle sind gemessen, versioniert und aus dem Repositorium reproduzierbar.
Sie ist die erste Tabelle des Dokuments, aus einem praktischen Grund: ein Benchmark wird in Stücken zitiert. Die Artgenauigkeit auf Brown 2017 misst eine Chemie von 2015 mit einer medianen Identität von 74 %, nicht das Werkzeug — und kein Werkzeug am Markt trägt bei dieser Datenqualität eine Artaussage. Jede Zeile nennt das Material, das die Zahl erzeugt hat.
| Material | Jahr · Chemie | Identität | Genus | Art | Reads auf Artebene |
|---|---|---|---|---|---|
| Brown et al. 2017 · 7 MinION-Datensätze | 2015 · R7.3/R9 | 74,23 % | 97,70 % | 37,4 % | 99 |
| ZymoBIOMICS D6300 · GridION vom Hersteller zertifizierte Zusammensetzung |
2019 · R9.4.1 | 88,77 % | 99,08 % | 97,24 % | 15.549 |
| ZymoBIOMICS D6300 · PromethION | 2019 · R9.4.1 | 88,77 % | 99,00 % | 97,14 % | 14.731 |
| Zymo HMW mock · PRJNA934154 aktuelle Chemie, Basecalling sup |
2023 · R10.4.1 | 97,30 % | 98,53 % | 97,26 % | 28.774 |
| Degradierte Serie aus D6300 härteste Stufe des Experiments aus §6 |
2019 degradiert | 74,23 % | 99,40 % | nicht behauptet | — |
Je besser die Chemie, desto mehr Reads werden bei gleicher Genauigkeit auf Artebene aufgelöst: 99 im Jahr 2015, 15.549 im Jahr 2019, 28.774 im Jahr 2023, stets über 97 % Trefferquote. Das ist das Verhalten, das man von einer Engine erwartet, die die Grenze der Daten respektiert: sie behauptet nicht zu viel, wenn das Material schlecht ist, und nutzt das Material aus, wenn es gut ist.
Jede Genauigkeit ist auf die Reads bedingt, die das System tatsächlich klassifiziert, und dieser Nenner wechselt von Zeile zu Zeile: 89,5 % der Reads im Jahr 2023 gegenüber 53,7 % im Jahr 2019. Deshalb steht die Read-Spalte in allen fünf Zeilen stets neben dem Prozentwert.
Brown et al. (2017) sequenzierten mit MinION vier Reinkulturen und mehrere Mischungen erklärter Zusammensetzung und veröffentlichten dazu die Genauigkeit von MG-RAST, Kraken und One Codex. Paytuví-Gallart et al. (2019) verarbeiteten genau diese Dateien mit GAIA neu und fügten der Tabelle ihre Spalte hinzu. Das ist der einzige Punkt, an dem eine OmniOta-Zahl neben der eines Wettbewerbers auf bekannter Wahrheit stehen kann: die Zusammensetzung der Proben ist nicht Ansichtssache, und die Zahl der Konkurrenz ist veröffentlicht.
Die übrigen Arbeiten Dritter, die GAIA verwendet haben — Hundekot, Luft in Ghana, Schweinemolke, Staub in Moskau — sind reale Proben ohne bekannte Zusammensetzung: sie zeigen, ob zwei Werkzeuge übereinstimmen, nicht welches richtig liegt.
„Accuracy for GAIA was calculated as: Accuracy = # reads classified correctly / # reads classified“
Von den Reads, die das Werkzeug zu klassifizieren wagt, welcher Anteil richtig ist. Nicht-Klassifizieren wird nicht bestraft; Falsch-Klassifizieren wird bestraft. OmniOta wird genau so gemessen und veröffentlicht zusätzlich die Abdeckung, die diese Metrik nicht erfasst.
Es bleibt ein Read pro Molekül: der längste unter denen mit gleicher Poren-Kennung. Es wird kein echter 2D-Konsens gebildet, da das Repositorium nur die Einzelstränge hinterlegt; gearbeitet wird also mit einer etwas schlechteren Qualität als sie GAIA hatte. Die Referenz umfasst 22.514 Genome, eines pro prokaryotischer Art auf der besten verfügbaren Assemblierungsstufe: 1.118.270 Sequenzen, 35,1 GB komprimiert in neun Teilen, mit der vollständigen Linie im Header jeder Sequenz. Alignment mit minimap2 -c -x map-ont -N 20 -p 0.8, ein Durchlauf pro Teil, gruppiert nach Read, damit jeder alle seine Alignments sieht.
Die beobachtete Identität eines Alignments ist (1 − ε) × evolutionäre Identität. Nur die zweite hat taxonomische Bedeutung. Der Sequenzierfehler wird aus dem Datensatz selbst geschätzt — 99. Perzentil der besten Identität pro Read — und die Schwellen für Identität, Abdeckung und Marge werden als Anteil dieser Obergrenze ausgedrückt, niemals als Absolutwerte.
Der Abstieg von der Domäne zur Art erfolgt über Konsens auf der nahezu optimalen Menge, mit Dereplikation nach Linie: stehen mehrere Bezeichnungen gleich, verbleibt der Read auf dem höheren Rang. Ein nicht identifizierbarer Rang wird nicht behauptet.
7 % Variation zwischen Datensätzen derselben Studie und derselben Chemie. Jede für einen davon gewählte absolute Schwelle wäre für die übrigen falsch kalibriert: daher wird die Skala bei jedem Lauf abgeleitet und nicht im Code fixiert.
Die Messung erfolgt auf Genusebene, weil das der Rang ist, den Brown et al. analysiert und in seiner Arbeit wörtlich erklärt hat, wobei genau die Datensätze dieses Vergleichs genannt werden. Die Spalten von MG-RAST, Kraken und One Codex haben die GAIA-Autoren derselben Arbeit entnommen, sie sind also mit Sicherheit auf Genusebene, und die GAIA-Spalte steht in derselben Tabelle im Vergleich zu ihnen. Die Überschrift des Supplements sagt „at species level“, und diese Unklarheit wird hier erklärt, damit jeder sie beurteilen kann.
Neun Datensätze, geladen aus dem European Nucleotide Archive, Projekte PRJEB8672 und PRJEB8716. Die Read-Zahlen stimmen in allen neun exakt mit den veröffentlichten überein: das ist der Nachweis, dass vom gleichen Material und nicht von einer bequemen Teilmenge ausgegangen wird. Die vier Organismen der Reinkulturen gehören zu vier verschiedenen Genera aus drei verschiedenen Phyla.
| Datensatz | Wahrheit | OmniOta | Abdeckung | GAIA | Kraken | One Codex | MG-RAST |
|---|---|---|---|---|---|---|---|
| Ecoli | E. coli | 95,00 % | 19,8 % | 100,0 % | 99,5 % | 98,7 % | 74,7 % |
| Pfluor | P. fluorescens | 94,64 % | 40,8 % | 85,83 % | 84,6 % | 84,2 % | 84,9 % |
| Maeru | M. aeruginosa | 96,58 % | 20,6 % | 96,39 % | 85,8 % | 95,1 % | 53,1 % |
| Selong | S. elongatus | 100,00 % | 12,0 % | 100,0 % | 98,1 % | 97,6 % | 87,9 % |
| Equal (5) c | Mischung aus 4 | 97,70 % | 24,4 % | 93,47 % | 97,6 % | 87,4 % | 65,0 % |
| Equal (6) c | Mischung aus 4 | 100,00 % | 3,3 % | 98,94 % | 98,0 % | 98,7 % | 85,9 % |
| Rare (6) c | Mischung aus 4 | 100,00 % | 3,6 % | 100,0 % | 99,1 % | 98,7 % | 92,9 % |
| Mittelwert (7) | 97,70 % | 17,8 % | 96,37 % | 94,67 % | 94,34 % | 77,77 % | |
| Aggregiert | 896/932 Reads | 96,1 % | IC 95 % [94,7 – 97,2] | — | — | — | — |
c Obergrenze: in einer Mischung zählt jeder Read, der einem der vier Mitglieder zugewiesen wird, als Treffer. Das betrifft alle fünf Werkzeuge gleichermaßen, deren veröffentlichte Zahlen an genau diesen Mischungen berechnet wurden. Die Abdeckung von GAIA fehlt, weil ihr Supplement sie nicht veröffentlicht hat; diese Spalte hat also kein Gegenstück und ist kein Vergleich.
OmniOta erzielt den höchsten Mittelwert der fünf Werkzeuge, und der größte Vorsprung tritt beim schwierigsten Datensatz auf: P. fluorescens, wo die vier veröffentlichten Werkzeuge zwischen 84,2 % und 85,8 % liegen und wir 94,64 % erreichen. Beide Mittelwerte werden veröffentlicht: der über Datensätze, weil er der einzige mit der Literatur vergleichbare ist, und der aggregierte, weil er der statistisch korrekte ist.
Ein Mittelwert aus sieben Prozentwerten gibt einem Datensatz mit 27 klassifizierten Reads dasselbe Gewicht wie einem mit 317. Er wird so berechnet, weil GAIA es so gemacht hat und ohne ihn kein Vergleich möglich wäre. Die aggregierte Schätzung lautet 896 Treffer von 932 Reads, Wilson-95-%-KI [94,7 % – 97,2 %], und dieses Intervall enthält die 96,37 % von GAIA: bei diesem Datenvolumen erreicht der mittlere Vorsprung keine Signifikanz, und das wird so erklärt. Der höchste Wert der Tabelle ist der unsere gegenüber allen vier veröffentlichten Wettbewerbern; was mehr Daten erfordern würde, ist die Behauptung, dieser Vorsprung wiederhole sich auf jedem anderen Datensatz.
Die Spalten von GAIA, Kraken, One Codex und MG-RAST sind die von ihren Autoren veröffentlichten: GAIA wurde nicht ausgeführt, da es ein geschlossener Dienst mit proprietärer Referenzdatenbank ist. Ein Teil der Differenz zwischen beiden Zahlen ist der Referenz und nicht der Methode zuzuschreiben, und ohne Zugang zu ihrer Datenbank gibt es keine Möglichkeit, ihn zu quantifizieren. Das Repositorium enthält eine Reproduktion der GAIA-Regel, nützlich zum Verständnis ihres Verhaltens, die in diesem Dokument nicht verwendet wird: unsere Reproduktion ihrer Methode gegen unsere Methode zu stellen wäre kein Vergleich zwischen Werkzeugen.
Shigella ist polyphyletisch innerhalb von Escherichia coli — Klone, die das Invasionsplasmid erworben haben — und die mittlere Nukleotididentität überschreitet die Artschwelle. Der Name wird aus klinischer, nicht taxonomischer Relevanz beibehalten. Auf Genusebene misst es ein Artefakt der Nomenklatur und keinen Irrtum des Klassifikators, einen Read von E. coli zugewiesen zu Shigella als Fehler zu zählen. Betroffen sind 36 der 78 Reads des Ecoli-Datensatzes: ohne die Zusammenführung lautete die Zahl 39,7 % statt 94,6 %, und deshalb wird sie erklärt.
Der Datensatz staggered es HM-783D von BEI Resources, el Microbial Mock Community B des Human Microbiome Project: zwanzig zertifizierte Arten verteilt zwischen 0,03 % und 41,25 % genomischer DNA. Er verlangt, S. aureus de S. epidermidis, drei Streptococcus voneinander zu unterscheiden und Mitglieder drei Größenordnungen unter dem dominanten zu erkennen — genau dort bricht ein Klassifikator wirklich, im Gegensatz zu vier gut getrennten Genera, die man fast durch Ausschluss trifft.
auf Genusebene, 185 von 191 klassifizierten Reads, Obergrenze, da es eine Mischung ist. Brown veröffentlichte 93 % auf genau diesem Material mit dem eigenen Ablauf. Er geht nicht in den Mittelwert der sieben Spalten ein, weil GAIA dafür keine Zahl veröffentlicht hat.
Vier der zwanzig Mitglieder haben seit 2010 den Genus gewechselt, und die aktuelle Referenz kennt nur den neuen Namen. Ohne Erklärung dieser Äquivalenz hätte der Prüfstand 20 % des Mocks als Fehler gezählt, obwohl es ein perfekter Treffer war. Die Wahrheit wird mit dem Namen der Quelle übertragen und die Äquivalenz lebt separat: die Wahrheit mit der heutigen Nomenklatur umzuschreiben würde sie konstruktionsbedingt mit unserer Referenz zur Deckung bringen, und der Vergleich würde nichts mehr prüfen. Ein Test-Wächter fixiert beide Richtungen — dass die Umbenannten passen und dass Kongenere nicht zusammengeführt werden — denn eine Synonymtabelle ist der bequeme Ort, um genau die passenden Zusammenführungen einzuschmuggeln.
ZymoBIOMICS Microbial Community Standard D6300, sequenziert von Nicholls, Quick, Tang und Loman (2019) auf GridION und PromethION. Zehn Arten mit im Herstellerdatenblatt zertifizierter Zusammensetzung: acht Bakterien mit 12 % genomischer DNA und zwei Hefen mit 2 %. 50.000 gemessene Reads pro Plattform, aus einem Präfix, das über 200.000 liefert — gegenüber den 5.600 2D-Reads des gesamten Brown 2017. Er liefert zwei Achsen, die das erste Material nicht geben konnte: Herstellerzertifizierung und eine Messung der Invarianz zwischen Sequenzierern.
| GridION | PromethION | |
|---|---|---|
| dem Genus zugewiesene Reads | 29.824 | 27.928 |
| Genauigkeit auf Genusebene | 99,08 % | 99,00 % |
| der Art zugewiesene Reads | 15.549 | 14.731 |
| Genauigkeit auf Artebene | 97,24 % | 97,14 % |
| größter Falschpositiver | 0,17 % | 0,21 % |
Es ist eine gemischte Gemeinschaft, die Genauigkeit ist also eine Obergrenze: jeder einem beliebigen Mitglied zugewiesene Read zählt als Treffer. Die Reads stammen aus dem Präfix des Laufs, das die ersten Stunden der Zelle überrepräsentiert; für den Vergleich zwischen Plattformen wirkt der Bias in beiden gleich, und für eine absolute Zahl stammt er aus dem besten Abschnitt des Laufs, und das wird gesagt. Die beiden Hefen kommen auf beiden Plattformen auf exakt 0,00 %: die Referenz wurde aus dem bakteriellen Katalog von RefSeq gebaut und enthält keine Pilze, und dass die Zahl auf beiden identisch ist, bestätigt es.
Dieselbe Gemeinschaft, dieselbe Vorbereitung, zwei verschiedene Sequenzierer. Die Frage wird für die zertifizierte Gemeinschaft und für alles Ausgegebene getrennt beantwortet, denn die Antworten unterscheiden sich, und nur eine von beiden zu geben würde etwas verbergen.
| Gemeinschaft | Alles Ausgegebene | |
|---|---|---|
| beobachtetes L1 | 0,0181 | 0,0231 |
| durch Stichprobe erwartetes L1 (p95) | 0,0257 | 0,0276 |
| divergente Taxa | 0 | 1 |
| Urteil | Invariant | no |
Die Zusammensetzung ist zwischen GridION und PromethION invariant. Die Unterschiede je Genus reichen von 0,05 bis 0,43 Punkte, und die Gesamtdivergenz ist praktisch die, welche die Stichprobenziehung selbst erzeugt: nicht „nahe null“, sondern statistisch nicht vom Zufall unterscheidbar, und genau das war zu zeigen.
Was sich nicht wiederholt, sind die Artefakte geringer Abundanz: Macrococcus, das kein Mitglied der Gemeinschaft ist, erscheint mit 23 Reads auf einer Plattform und 5 auf der anderen. Die Zusammensetzung wiederholt sich; die Spuren nicht. Das ist ein unmittelbarer betrieblicher Hinweis darauf, welches Gewicht einem von zwanzig Reads getragenen Taxon zukommt, und es deckt sich mit der Wilson-Doktrin, die das Produkt bereits auf die Konfidenz je Taxon anwendet.
Das Datenblatt des D6300 nennt fünf Zusammensetzungsspalten für dieselbe Gemeinschaft: genomische DNA, 16S, 16S&18S, Genomkopien und Zellen. Sie ist in DNA gleichmäßig — 12 % je Bakterium — und in 16S tief ungleich: P. aeruginosa geht von 12 % auf 4,2 % und L. fermentum del 12 % al 18,4 %, ein Faktor ×4,4 zwischen beiden. Und S. cerevisiae macht 9,3 % des 16S&18S und 0,29 % der Zellen aus: zwei richtige Antworten auf zwei verschiedene Fragen. Ein Shotgun-Ergebnis gegen die 16S-Spalte zu stellen würde einen Bias dieser Größe erzeugen, der dem Prüfstand und nicht der Engine zuzuschreiben ist — genau das korrigiert die Normalisierung nach Genomgröße in der Produktion, und hier ist das Material, das es ohne Diskussion belegt.
Ein Produkt von 2026, bewertet auf der Chemie von 2019, ist ein berechtigter Einwand, und er wird nicht mit Argumenten, sondern mit Messungen beantwortet. ZymoBIOMICS HMW DNA Standard, ONT R10.4.1 bei 5 kHz mit Kit 14, Studie PRJNA934154 von 2023. Die Identität wird durch Alignment gegen die Referenzgenome des Standards gemessen; sie wird nicht dem Datenblatt des Herstellers entnommen.
| Material | Chemie | Gemessene Identität |
|---|---|---|
| Brown et al. · 2015 | R7.3 / R9 | 74,23 % |
| Nicholls et al. · 2019 | R9.4.1 | 88,77 % |
| Zymo HMW mock · 2023 | R10.4.1 (sup) | 97,30 % |
Zwischen dem bisher verwendeten Material und der aktuellen Chemie liegen 8,5 Identitätspunkte. Das ist keine Nuance: es ist der Unterschied zwischen der Nähe zur Wand eines Verfahrens mit exakten k-meren und der Ferne davon. Perzentile des modernen Materials: p25 = 95,14 %, p75 = 98,16 %, p95 = 98,92 %, p99 = 99,33 %.
| Genus | Art | |
|---|---|---|
| klassifizierte Reads | 89,5 % | 57,5 % |
| Genauigkeit | 98,53 % | 97,26 % |
| gefundene Mitglieder des Standards | 7/7 | 7/7 |
Gegenüber dem Material von 2019 steigen die auf Artebene aufgelösten Reads von 31,1 % auf 57,5 % bei gleicher Genauigkeit (97,24 → 97,26 %). Mit aktueller Chemie löst das System fast doppelt so viele Reads auf Artebene auf, ohne an Treffsicherheit zu verlieren. Die Genusgenauigkeit liegt einen halben Punkt unter der von 2019, aus dem umgekehrten Grund: hier gehen 89,5 % der Reads ein statt 53,7 %, also gehen auch die schwierigen ein.
Derselbe Lauf ist mit allen drei Basecallern von ONT veröffentlicht. Gleiche Rohsignale, gleiche Pore, gleiche Probe, gleicher Tag: die einzige Variable ist die Software, die Signal in Basen übersetzt.
| Basecaller | Identität | Aligniert |
|---|---|---|
| fast | 89,80 % | 9.423 |
| hac | 96,16 % | 9.456 |
| sup | 97,30 % | 9.464 |
Ein Lauf von 2023 mit Basecalling fast landet bei derselben Identität wie das Material von 2019 mit dem besten Basecalling.
Niedrige Identität ist kein historischer Zustand, den die Branche hinter sich gelassen hat: es ist ein Zustand, in den man heute gerät, durch eine gewöhnliche betriebliche Entscheidung — den schnellen Basecaller zu nutzen, weil sup Stunden GPU kostet — und auch mit thermisch degradierter DNA, einer schwer zu extrahierenden fetthaltigen Matrix oder einer Flusszelle am Ende ihres Lebens. fast verbraucht 7,5 der ~15 Margenpunkte, die das moderne Material von dem Punkt trennen, an dem ein Verfahren mit exakten k-meren kein Ergebnis mehr zurückgibt. Die Hälfte des Polsters, für ein Kästchen.
Auf der 16S/Amplikon-Achse deckt der Prüfstand die Chemie R10.4.1 bereits mit Material von September 2025 ab (MSPlus-Gemeinschaft, ont-open-data/zymo_16s_2025.09): 12 von 12 Mitgliedern erkannt, null regulierte Falschpositive, eine Überbehauptung. Gemessen und in der Dokumentation zur taxonomischen Auflösung festgehalten und hier als das zitiert, was es ist: eine Messung aus einer anderen Sitzung, in dieser nicht erneut ausgeführt.
Zwischen Brown 2017 und Zymo D6300 ändert sich alles gleichzeitig: das Jahr, die Chemie, der Sequenzierer, die Gemeinschaft, das Labor und die Identität der Reads. Bei zwei Punkten, die sich in sechs Variablen unterscheiden, ist es nicht gerechtfertigt, einen Einbruch einer von ihnen zuzuschreiben, und die naheliegende Entgegnung jedes Gutachters wäre die richtige: Sie haben einen alten Datensatz gewählt.
Dieses Experiment existiert, damit dieser Satz nicht mehr entgegenzuhalten ist. Es nimmt dieselbe Datei von Zymo und injiziert Fehler in steigenden Raten, mit festem Startwert und drei Tiefen, um Identität von Tiefe zu trennen. Alles Übrige ist konstruktionsbedingt identisch: die einzige freie Variable ist die Identität. Und es hätte gegen uns ausgehen können: hätte sich der Einbruch nicht reproduziert, wäre die veröffentlichte Erklärung falsch und müsste zurückgezogen werden. Genau deshalb zählt es.
Nur Substitutionen, keine Insertionen oder Deletionen. Der reale Nanoporenfehler enthält Indels, und sie sind más zerstörerisch für ein exaktes k-mer, weil sie den Rahmen der 31 Basen verschieben statt eine Position zu brechen. Das Auslassen der Indels macht das Experiment konservativ zugunsten des Wettbewerbers: ihm wird das mildere der beiden Szenarien gegeben. Die Identität wird durch Alignment gemessen, nicht angenommen: auf Material mit 88,77 % ergibt eine Injektion von 20 % nicht 80 %, sondern 74,23 %.
Die stärkste Degradationsstufe landet bei 74,23 %, also der medianen Identität von Brown 2017. Das Experiment erreicht konstruktionsbedingt genau den Punkt, den es erklären wollte, ausgehend von modernem, zertifiziertem Material: ein Datensatz von 2015 war nicht nötig, es genügt, den von 2019 zu degradieren.
| Identität | Mitglieder OmniOta |
Genauigkeit auf Genusebene |
Taxa sylph |
Genera unecht |
|---|---|---|---|---|
| 88,77 % | 8/8 | 99,07 % | 8 | 0,93 % |
| 87,17 % | 8/8 | 99,16 % | 7 | 0,84 % |
| 84,91 % | 8/8 | 99,29 % | 6 | 0,71 % |
| 82,65 % | 8/8 | 99,18 % | 0 | 0,82 % |
| 79,68 % | 8/8 | 99,44 % | 0 | 0,56 % |
| 76,84 % | 8/8 | 99,37 % | 0 | 0,63 % |
| 74,23 % | 8/8 | 99,40 % | 0 | 0,60 % |
sylph-Spalte bei 5.000 Reads; bei 20.000 und 50.000 verschiebt sich der Einbruch, reproduziert sich aber gleichermaßen. Die Wahrheit sind 8 Mitglieder auf allen sieben Stufen.
Alle acht Organismen der Gemeinschaft werden auf jeder Stufe wiedergefunden, auch auf der am stärksten degradierten — genau derjenigen, auf der der Wettbewerber keine einzige Zeile zurückgibt. Das ist das Ergebnis, das für eine echte Lebensmittelprobe zählt: durch Hitzebehandlung fragmentierte DNA, fetthaltige Matrix, schwierige Extraktion.
Die Genauigkeit steigt mit der Degradation, und das ist kein Verdienst: es ist Selektionsbias. Sie ist auf die Reads bedingt, die das System tatsächlich klassifiziert; mit der Degradation überschreiten die zweifelhaften die Schwelle nicht mehr und die leichten bleiben übrig, sodass die Trefferquote über die Überlebenden durch Selektion und nicht durch Leistungsfähigkeit steigt. Die Zahl, die diesen Abschnitt trägt, ist die der gefundenen Mitglieder — 8/8 — samt den klassifizierten Reads, die von 53,7 % auf 36,6 % fallen.
Gegen GAIA stehen nur seine veröffentlichten Zahlen zur Verfügung: es ist ein geschlossener Dienst mit proprietärer Referenzdatenbank, sodass selbst eine Ausführung die Referenzasymmetrie nicht beseitigen würde. Mit sylph (Shaw & Yu, Nature Biotechnology 2024) ist es möglich: ihm wurden genau dieselben 22.514 Genomeübergeben, eines nach dem anderen, mit einem in 296 s gebauten Index. Und MetaPhlAn 4.2.6 wurde auf derselben Datei mit seiner eigenen Markerdatenbank ausgeführt, der einzigen, die es zulässt.
| OmniOta | sylph | |
|---|---|---|
| Genauigkeit pro Read auf Genusebene | 99,18 % | nicht anwendbar |
| gefundene Mitglieder der Gemeinschaft | 8/8 | 8/8 |
| ausgegebene Taxa | 61 | 8 |
| Gewicht der überzähligen Taxa | 0,82 % | — |
| Profilierungszeit | ~75 min | 24 s |
Beide Werkzeuge finden die vollständige Gemeinschaft, und jedes ist auf einer anderen Achse stärker. Pro Read ist OmniOta sehr präzise: 99,18 %, und das ist die Zahl, die eine Abundanztabelle und alles darauf Berechnete bestimmt. Pro benanntem Taxon entscheidet sylph besser: es gibt 8 aus, wo wir 61 ausgeben, weil es die Genomabdeckung mit k-mer-Statistik modelliert und verlangt, dass das Genom wirklich vorhanden ist, bevor es benannt wird, während wir jedes Taxon benennen, das eine Read-Zuweisung erhält.
Die 53 überzähligen Taxa summieren sich auf 0,82 % der Reads —Microbacterium 51, Streptomyces 43, Macrococcus 23 und ein Schwanz unter jeweils zehn Reads — und das in Entwicklung befindliche Kriterium ist eine Mindestevidenz zum Benennen eines Taxons, nicht bloß zum Zuweisen von Reads: dieselbe Wilson-Doktrin, die das Produkt bereits auf die Konfidenz je Taxon anwendet, weitergeführt bis zur Entscheidung über die Veröffentlichung. Das ist mit der Messung aus §4.2 konsistent: die Zusammensetzung wiederholt sich zwischen Plattformen, die Spuren nicht.
Die beiden Zeiten sind nicht direkt vergleichbar: die ~75 min umfassen das Alignment gegen die neun Teile der Referenz mit Neubau des Index in jedem Durchlauf, während sylph einen einmal gebauten Index wiederverwendet. Mit persistentem Index würde der Unterschied deutlich schrumpfen, und diese Messung steht noch aus. sylph ist ein Profiler: es liefert die Liste der vorhandenen Genome mit ihrer Abundanz und weist nicht jeden Read zu, daher hat es keine Spalte für Genauigkeit pro Read. Shigella boydii in seiner Ausgabe ist kein Falschpositiver: es ist der Komplex Escherichia/Shigella, als Treffer gezählt nach demselben Kriterium, das in §3.1 auf OmniOta angewandt wird.
Kraken2/Bracken ist nicht gemessen: seine Datenbank mit genau diesen 22.514 Genomen würde in der Größenordnung von 170 GB RAM verlangen, gemessen, daher wird der Grund veröffentlicht, anstatt ihm eine beschnittene Datenbank zu geben, die den Vergleich verfälschen würde.
Die zertifizierte Zusammensetzung des HMW-Standards ist zwischen Bakterien äquimolar: 14,3 % genomische DNA je Art. Beim Zählen von Reads vereinte Salmonella 47,1 % und Bacillus 3,2 %. Es ist kein Teilmengen-Bias — die Profile der ersten und der letzten 10.000 Reads sind praktisch identisch — es ist die Metrik. Reads zu zählen ist nicht DNA-Masse zu zählen. Abundanz ist die mittlere Abdeckung, alignierte Basen geteilt durch die Genomgröße, und genau daran halten sich CoverM, sylph und CAMI.
| Organismus | Nach Reads | Abdeckung | MetaPhlAn | Zert. |
|---|---|---|---|---|
| S. enterica | 47,1 % | 25,2 % | 25,6 % | 14,3 % |
| E. faecalis | 11,9 % | 21,3 % | 23,3 % | 14,3 % |
| S. aureus | 4,8 % | 16,9 % | 18,9 % | 14,3 % |
| L. monocytogenes | 4,0 % | 13,0 % | 9,3 % | 14,3 % |
| E. coli | 24,0 % | 10,7 % | 13,7 % | 14,3 % |
| B. subtilis | 3,2 % | 7,6 % | 4,2 % | 14,3 % |
| P. aeruginosa | 4,9 % | 5,3 % | 4,9 % | 14,3 % |
| L1-Divergenz | 0,852 | 0,411 | 0,501 | — |
DNA-Masse zu messen statt Reads zu zählen halbiert den Fehler — 51,8 % weniger — an Material mit zertifizierter Zusammensetzung. Beim Zählen von Reads erschien Salmonella mit 3,3-facher realer Masse und Bacillus mit einem Viertel der seinen. Die Regel ist keine Stilfrage.
Der Vergleich mit MetaPhlAn zählt gerade deshalb, weil die beiden Werkzeuge nichts teilen: wir alignieren gegen 22.514 vollständige Genome, MetaPhlAn profiliert gegen seine kladenspezifischen UniRef-Marker. Die beiden Methoden stimmen im Mittel auf 2,14 Punkte überein und in der Reihenfolge der drei größten, sodass das sequenzierte Material nicht äquimolar ist, und das ist auf zwei unabhängigen Wegen belegt. Und in dem, was tatsächlich im Wettbewerb steht, liegt OmniOta 18 % näher an der zertifizierten Zusammensetzung: L1 0,411 gegenüber 0,501.
Für die verbleibende Divergenz gibt es mindestens zwei bekannte referenzseitige Ursachen, bevor man eine der Methode anführt: das „E. coli“ des Panels ist das Genom von Shigella boydii und die Abdeckung gegen ein Ersatzgenom zu messen unterschätzt sie; dasselbe gilt für P. aeruginosa PAO1. Es bleibt Raum für echten Extraktions- und Lyse-Bias, den dieses Experiment nicht vom Vorgenannten trennt. MetaPhlAn erkennt S. cerevisiae und wir nicht, weil unsere Referenz bakteriell ist: es ist eine Fähigkeit von ihnen, die wir nicht haben.
| Dokumentversion | 1.4.0 |
| Datum der Messung | 2026-08-10 |
| Engine | minimap2-lca/3.0.0 |
| Arbeitsbaum | 61a0bb7c |
| Referenz | 22.514 Genome · 1.118.270 Sequenzen · 35,1 GB |
| Aligner | minimap2 · map-ont · N 20 · p 0.8 |
| hier ausgeführte Wettbewerber | sylph · MetaPhlAn 4.2.6 |
Die Verfahren zum Herunterladen des Materials, zum Bau der Referenz und zur Messung sind im Repositorium als ausführbare Befehle veröffentlicht, und jede methodische Entscheidung dieses Dokuments ist durch einen automatischen Test-Wächter fixiert, der den Text gegen das JSON des Laufs prüft: ändert jemand eine Zahl im Text ohne neu zu messen, schlägt der Test fehl.
Die vollständigen Details jeder Achse — erweiterte Vorbehalte, Ergebnisse je Datensatz, die Versionshistorie des Prüfstands und die wegen fehlender Reproduzierbarkeit zurückgezogenen Zahlen — liegen in der kanonischen Dokumentation des Repositoriums, die unter Vereinbarung zur technischen Bewertung verfügbar ist.