Modellergebnisse · offene Methode
Mehrere Quellen. Sichtbare Unterschiede.
Ein Benchmark allein zeigt nicht die ganze Leistung. Dieser Vergleich gibt jeder Quelle denselben Platz und nennt auch fehlende und schwächere Ergebnisse.
| Modellprofil | Decision Index0.2.1Zufallsbereinigter Index / 100Unabhängige Community | Workflow EvalsDatensätze 2026-09-28 · Code 0ac3b8aÜbereinstimmung mit ModellreferenzenTypeSafe · Referenzanbieter | Jev Rerank Bench2026-09-25Datensatz-Mittel nDCG@10 / 1Unabhängiger Autor | JevBench1.5.1Gesamtwertung / 100Derselbe Gründer wie System1 | ImageJevBench0.1.4Gesamtwertung / 100Derselbe Gründer wie System1 |
|---|---|---|---|---|---|
| s1-fastPlumb-4B | Nicht gemessen¹ | Nicht gemessen¹ | Nicht gemessen¹ | 71,56 | Nicht gemessen¹ |
| s1-proWinnow-12B Q8 | 50,02 | Nicht gemessen¹ | 0,634 | 73,23 | 43,56 |
| TypeSafe-ReferenzJev 1.13.0 | 57,91 | 67,8 | 0,670 | 72,13 | Nicht gemessen¹ |
¹ Nicht gemessen bedeutet: Für dieses Modell wurde keine vergleichbare veröffentlichte Messung verifiziert; es ist kein Nullwert. Ergebnisse beziehen sich auf die getesteten Modellimplementierungen, nicht auf den System1-Dienst. ImageJevBench betrifft einen gesonderten Bildpfad; Bildeingabe für Kunden folgt in Kürze.
Interessenkonflikt: JevBench und ImageJevBench werden vom Gründer von System1 Models betrieben. Workflow Evals wird von TypeSafe AI veröffentlicht, dem Anbieter des Referenzmodells. Es misst Übereinstimmung mit Modellreferenzen, keine Genauigkeit gegen menschliche Labels. Keine Gesamtwertung bei unvollständiger vergleichbarer Abdeckung. Methode und Quellen →
Gleich gewichtet, mit sichtbaren Lücken
Alle fünf Benchmarks erhalten gleich breite Spalten und dieselbe Gestaltung. Die angegebenen Einheiten bleiben getrennt: Index, Referenzübereinstimmung, nDCG und Gesamtwert sind unterschiedliche Messgrößen. Untermetriken oder Modellkarten mit denselben Daten zählen nicht als zusätzliche Stimmen.
Es gibt keine Gesamtwertung, weil eine gemeinsame Menge vergleichbarer Messungen fehlt. Falls später eine Gesamtwertung erscheint, wird sie das ungewichtete arithmetische Mittel einer vorab benannten gemeinsamen Benchmark-Menge sein: Mittelwert(100 × Wert / Skala). Fehlende Werte werden nicht stillschweigend ausgelassen oder als null behandelt. Bereits erfolgte Zufallsbereinigung bleibt erhalten.
Wo unsere Profile schlechter abschneiden
s1-fast (Plumb-4B) hat ein veröffentlichtes vergleichbares Ergebnis: Sein JevBench-Gesamtwert liegt unter der TypeSafe-Referenz. Für die anderen vier Quellen fehlt ein vergleichbares Ergebnis.
Das Winnow-Q8-Ergebnis liegt im Decision Index unter der TypeSafe-Referenz. Auch beim Retrieval mit derselben Ja/Nein-Methode pro Paar liegt es darunter. Sein JevBench-Gesamtwert ist geringfügig höher, bei überlappenden Konfidenzintervallen; diese Kennzahl enthält angenommene Geschwindigkeitsanpassungen und geschätzte Hostingkosten. Die Intelligenzachse von s1-fast liegt deutlich unter der Referenz; sein Gesamtwert profitiert von geschätzter Geschwindigkeit und Kosten. Diese Unterschiede bleiben im Vergleich sichtbar. Die Bildmessung ist kein Nachweis eines verfügbaren Kunden-Bilddienstes.
Quellen und Grenzen
Decision Index · 0.2.1
38 Index-Benchmarks in fünf Bereichen, zufallsbereinigt und nach Abdeckung angepasst. Der Winnow-Q8_0-Eintrag nennt keine Checkpoint-Revision. Ergebnisse der Modellimplementierung, keine System1-Dienstmessung. Die Board-Laufzeit nutzt Label-Lift; eine identische System1-Konfiguration ist nicht belegt.
Primärquelle → · Originaldaten → · Stand: 2026-09-28. Geprüft: 2026-09-30.
Workflow Evals · Datensätze 2026-09-28 · Code 0ac3b8a
Vier öffentliche Workflow-Datensätze, 705 Fälle. Der Jev-Wert ist das ungewichtete Mittel der ersten veröffentlichten Kennzahl pro Workflow gegen Konsenslabels: Rechnungen und Kundendienst verwenden exakte Aktionsmengen (accuracy), Sicherheitsvorfälle exakte Aktionsmengen (agreement), Agenten-Traces die primäre Aktion (disposition). Referenzmodus: alle Fragen, ohne Reasoning. Die Referenzen kombinieren Antworten großer Modelle, teils mit Ersatzmodellen; keine menschlichen Goldlabels. Für Plumb und Winnow sind dort keine Läufe veröffentlicht. Code und Daten sind öffentlich; eigene Profil-Läufe sind vorbereitet, aber hier nicht als Ergebnis behauptet.
Primärquelle → · WorkflowEvals-Code → · Öffentliche Datensätze → · Stand: 2026-09-28. Geprüft: 2026-09-30.
Jev Rerank Bench · 2026-09-25
Acht englische Retrieval-Datensätze, 1.617 gewertete Fragen. Beide Modelle nutzen dieselbe Ja/Nein-Methode pro Frage-Passage-Paar. Winnow-Q8-Checkpoint b2b1421 ist genannt. RTX-A5000-Messungen sind keine System1-Dienstleistung. Trainingsüberschneidungen mit öffentlichen Datensätzen lassen sich nicht ausschließen. nDCG misst Rangqualität, keine Klassifikationsgenauigkeit. Die Referenz hat außerdem eine stärkere mehrstufige Batch-Konfiguration; Winnow wurde mit dieser Methode nicht getestet. Die vergleichbare Zeile ist daher nicht die Leistungsgrenze des Referenzmodells.
Primärquelle → · Stand: 2026-09-25. Geprüft: 2026-09-30.
JevBench · 1.5.1
Veröffentlichte Version 1.5.1. Der Gesamtwert gewichtet Intelligenz, Kalibrierung, Geschwindigkeit und Kosten intern gleich. Dieser Vergleich nutzt nur veröffentlichte Aggregatwerte; kein Text versiegelter Aufgaben wurde dafür verwendet. Die getesteten Checkpoint-Revisionen werden in den Plumb- und Winnow-Zeilen nicht angegeben. Lokale GPU-Zeiten werden durch angenommene Faktoren und Gateway-Zuschläge angepasst; Hostingkosten sind geschätzt. Die TypeSafe-Referenz verwendet beobachtete API-Zeiten und Listenpreise. Keine System1-Dienstmessung.
Primärquelle → · Originaldaten → · Stand: 2026-09-29. Geprüft: 2026-09-30.
ImageJevBench · 0.1.4
Öffentliche Version 0.1.4, 50 Systeme; Winnow Q8_0 mit F16-Bildprojektor. Gesonderter Bildpfad; Bildeingabe für Kunden folgt in Kürze. Die Zeile nennt weder die getestete Checkpoint-Revision noch den Hash des Bildprojektors. Für Plumb oder TypeSafe Jev 1.13.0 keine vergleichbare Bildzeile. Ergebnisse anderer Bildmodelle werden nicht eingesetzt. Die zurückgehaltene Version 0.2 wird nicht verwendet.
Primärquelle → · Stand: 2026-09-29. Geprüft: 2026-09-30.
Weitere Quellen und Modellkarten
Wir haben außerdem primäre Quellen von Artificial Analysis, Epoch AI, Vals und Hugging Face geprüft. In den geprüften Quellen wurde kein verifiziertes Ergebnis für genau Plumb oder Winnow gefunden. Ergebnisse der Basismodelle werden nicht auf die Fine-Tunes oder den gehosteten Dienst übertragen. Autor-Messungen bleiben als solche gekennzeichnet und zählen nicht erneut als unabhängige Benchmarks.
Plumb-Modellkarte (fixierte Revision) → · Winnow-Modellkarte (fixierte Revision) → · Artificial Analysis → · Epoch AI → · Vals →
Exakte Werte, Prüfdatum, Quellen, Hashes und Revisionen: Quelldaten und exakte Werte.