Öffentlicher Benchmark
Gemessen an echten Memory-Aufgaben mit zwei Prüfungen
Wir messen Engram zweifach: findet es die richtige Evidenz, und kann ein LLM daraus korrekt antworten?
Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.
LoCoMo Evidenz-Retrieval
Vollständiger öffentlicher Lauf. Die Scores zeigen, ob die benötigte Quelle in den abgerufenen Memories erscheint.
| System | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo Antwortbewertung
Codex/self-review-Diagnose auf denselben 98 Aufgaben. Bewertet, ob die generierte Antwort aus dem abgerufenen Kontext korrekt ist.
| System | Top-50-Antwort | Top-200-Antwort | vs. Basismodell |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
So liest man R@200 und Top-200
Evidence Retrieval ist kumulativ: R@200 enthält alles aus R@50 plus mehr, sollte also nicht niedriger sein. Antwortgenauigkeit ist anders. Mehr Kontext kann auch Noise oder widersprüchliche Memories bringen; Top-50 antwortet manchmal sauberer, Top-200 testet, ob das Packaging mit mehr Evidence noch nützlich bleibt.