Öffentlicher Benchmark

Engram-Benchmarkmethodik

Sehen Sie öffentliche Datensätze, Retrieval-Metriken, Antwortprüfungen, Baselines, Grenzen und Regeln hinter den veröffentlichten Ergebnissen.

LoCoMo Evidenz-Retrieval92.19%
LoCoMo Antwortbewertung66.33%
So funktioniert's
01

LoCoMo Evidenz-Retrieval

Vollständiger öffentlicher Lauf. Die Scores zeigen, ob die benötigte Quelle in den abgerufenen Memories erscheint.

02

LoCoMo Antwortbewertung

Codex/self-review-Diagnose auf denselben 98 Aufgaben. Bewertet, ob die generierte Antwort aus dem abgerufenen Kontext korrekt ist.

03

So liest man R@200 und Top-200

Evidence Retrieval ist kumulativ: R@200 enthält alles aus R@50 plus mehr, sollte also nicht niedriger sein. Antwortgenauigkeit ist anders. Mehr Kontext kann auch Noise oder widersprüchliche Memories bringen; Top-50 antwortet manchmal sauberer, Top-200 testet, ob das Packaging mit mehr Evidence noch nützlich bleibt.

1,536

bewertete Retrieval-Fragen

92.19%

Engram R@50

66.33%

Antwortgenauigkeit aus Top-50-Kontext

Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.

LoCoMo ↗

Wir messen Engram zweifach: findet es die richtige Evidenz, und kann ein LLM daraus korrekt antworten?

Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.

Support und Feedback

Hilf uns, Engram zu verbessern

Wenn Setup verwirrend ist, ein Tool seltsam reagiert oder ein Preislimit falsch wirkt, schreib uns hier. Die Nachricht landet direkt bei uns.

Support und Feedback

Was sollen wir verbessern?

Bugs, verwirrende Setup-Schritte, Preisfragen und Produktideen gehen direkt ans Engram-Team.

Noch 10 Zeichen nötig0/10