Benchmark · LongMemEval-S 2026-05-18 · Audit SC-HEK-2026-05-17-KNM
knowmind im Vergleich.
Drei Sucharchitekturen gegen denselben Test-Korpus, dieselben Fragen, dieselbe Umgebung: knowmind, reine Volltext-Suche und einfache Teilzeichenketten-Suche. Dazu Referenzwerte anderer Anbieter aus deren eigenen Veröffentlichungen.
Wichtig zur Einordnung: Dies ist kein direkter Head-to-Head-Bench gegen Mem0, Zep, cognee oder Letta. Die Konkurrenz- werte stammen aus deren eigenen publizierten Benchmarks (LongMemEval, LOCOMO, DMR) mit unterschiedlichen Korpora und Methoden. Die knowmind- Werte sind selbst gemessen. Direkter Vergleich nur näherungsweise möglich. Rohdaten + Bench-Script auf Anfrage zur Reproduktion.
Eigene Messung, Stand 20. August 2026
Bestand mit rund 1.300 Erinnerungen aus dem internen Arbeitsbereich von Schübeler Consulting. Gemessen wurde über dieselbe Schnittstelle, die auch ein Kunde nutzt, gegen den vollständigen Prüfsatz von 59 Fragen — nicht gegen eine Auswahl. Treffer bedeutet: Mindestens einer der fünf besten Treffer enthält die richtige Quelle. Skripte, Goldstandard und Roh-Daten sind reproduzierbar auf github.com/Schubeler-Consulting/knowmind-benchmark. Bei 59 Fragen liegt das 95-Prozent-Konfidenzintervall für die gemessenen 79,7 Prozent rechnerisch bei etwa 69 bis 90 Prozent. Ihr eigener Korpus kann darüber oder darunter liegen.
| System | Strategie | Recall@5 | Latenz | Hosting | Lizenz | Eigenes KI-Abo |
|---|---|---|---|---|---|---|
| knowmind | Kombiniert Volltext, Bedeutungssuche und Wissensgraph; Namen und Personen werden gezielt aufgelöst (Identity-Routing) | 79,7 % (n=59) | 1.736 ms | DE (Hetzner) | Proprietär, SaaS | optional |
| Klassisches Vector-RAG | Reines Embedding-Retrieval ohne Hybrid-Stages | 57,6 % (n=59) | 1.748 ms | identisch | Open Source | n/a |
| Dateinamen-Suche | Token-Treffer im Dateinamen, Top-K nach Match-Anzahl | 37,3 % (n=59) | 6 ms | identisch | Open Source | n/a |
| Volltext-Suche (ripgrep) | Stichwort-Treffer in allen Dateien, Top-K nach Match-Anzahl | 15,3 % (n=59) | 148 ms | identisch | Open Source | n/a |
Wie viel muss ein Assistent lesen, bis er die Antwort hat?
Ein Assistent, der eine Frage über Ihren Wissensbestand beantworten soll, muss die passenden Stellen erst finden und dann lesen. Beides verbraucht Kontext, und Kontext ist die knappste Größe jedes Modells: Was einmal darin steht, wird bei jeder weiteren Antwort erneut mitgeschickt. Wir haben beide Wege am selben Bestand gemessen: dreißig Fragen aus dem Arbeitsalltag, einmal über knowmind und einmal über eine Volltextsuche, die die fünf treffendsten Dateien öffnet und ganz liest, so wie ein Agent es täte, der kein Gedächtnis hat.
knowmind
1.051 Token
Kontext je Antwort. Gemessen an denselben Fragen wie die Zahl daneben.
Volltextsuche über Dateien
59.398 Token
Kontext je Antwort — das Fünfzigfache für dieselbe Frage.
Der Assistent liest damit das Sechsundfünfzigfache, um seltener zu finden, wonach er gesucht hat. Für die Praxis heißt das zweierlei: Der Platz im Kontextfenster bleibt für die eigentliche Arbeit frei, und die Kosten sinken, weil jede weitere Antwort denselben Kontext mitträgt.
Messung vom 20. August 2026, 60 Fragen, derselbe Bestand für beide Verfahren. Die Tabelle oben zählt die zurückgegebenen Textstellen; hier zählt, was am Ende tatsächlich im Kontextfenster landet. Verglichen wurde mit einer Volltextsuche über Textdateien, nicht mit anderen Gedächtnissystemen; deren Werte stehen weiter unten. Der Vorteil gilt für Fragen mit einem inhaltlichen Anker: Wer nur „und weiter?" fragt, bekommt von knowmind bewusst nichts zurück.
Referenzwerte aus publizierten Benchmarks.
Andere Memory-Anbieter und Suchstacks — Werte aus deren eigenen Whitepapers bzw. unabhängigen Benchmarks. Korpora unterscheiden sich (LongMemEval, LOCOMO, DMR); direkter Vergleich nur näherungsweise möglich.
| System | Strategie | Recall@5 | Latenz | Hosting | Lizenz | Eigenes KI-Abo |
|---|---|---|---|---|---|---|
| Zep | Wissensgraph mit Zeitachse | ~76 % (LongMemEval, Anbieterangabe) | — | US (AWS) | Apache 2.0 + SaaS | teilweise |
| cognee | Graph-basiertes Wiederauffinden | ~75 % (eigene Evals) | — | US / EU | MIT + SaaS | teilweise |
| Letta (MemGPT) | Hierarchisches Gedächtnis | ~70 % | — | US | Apache 2.0 + SaaS | ja |
| Mem0 | Faktenextraktion durch LLM | ~70 % (LongMemEval, Anbieterangabe) | — | US | OSS + Cloud | ja |
| Pinecone (pur) | Reine Vektorsuche | ~60 % | — | US (AWS/GCP) | Proprietär, SaaS | n/a |
| Elasticsearch | Stichwort-Suche | ~25–45 % | — | self-hosted | Elastic License | n/a |
| ChatGPT Long-Context | Kompletter Korpus im Prompt | limitiert | — | US | Proprietär | — |
Methodik
- 20 typische Wissensarbeits-Fragen in deutscher Sprache, Goldstandard mit zwei bis fünf erwarteten Schlüsselwörtern pro Frage.
- Recall@5: einer der fünf besten Treffer enthält mindestens ein erwartetes Schlüsselwort.
- knowmind über die offizielle Schnittstelle aufgerufen, Vergleichsverfahren auf demselben Test-Korpus.
- Referenzwerte anderer Anbieter aus deren publizierten Whitepapers übernommen.
- Antwortzeit: Mittelwert nach Aufwärmphase, gemessen am Hetzner-Standort Nürnberg.
Rohdaten und Script auf Anfrage. Die hier gezeigten Werte stammen aus einem internen Test-Korpus, alle Inhalte intern und nicht öffentlich. Für eine M&A-Diligence stellen wir den vollen Datensatz unter NDA zur Verfügung.
Messen Sie es an Ihrem eigenen Wissen
Legen Sie eigene Notizen ein und stellen Sie Ihre eigenen Fragen. Ob die richtige Quelle unter den ersten Treffern steht, sehen Sie an Ihrem Material in wenigen Minuten.