Öffentlicher Benchmark
Gemessen an echten Memory-Aufgaben mit zwei Prüfungen
Wir messen Engram zweifach: findet es die richtige Evidenz, und kann ein LLM daraus korrekt antworten?
Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.
LoCoMo Evidenz-Retrieval
Vollständiger öffentlicher Lauf. Die Scores zeigen, ob die benötigte Quelle in den abgerufenen Memories erscheint.
| System | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo Antwortbewertung
Jede Zeile nutzt den vollständigen Satz von 1.536 Aufgaben mit Evidenz und denselben Top-50-Grenzwert. Codex erzeugte die Antworten; ein separater blinder Prüfer bewertete sie. Dies ist eine von Engram durchgeführte Diagnose, keine offizielle LoCoMo-Rangliste.
| System | Richtig / N | Top-50-Antwort |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
So lesen Sie die beiden Tabellen
Beide veröffentlichten Auswertungen nutzen alle 1.536 Aufgaben mit Evidenz. Die Evidenzsuche benötigt Quell-IDs; für jedes einbezogene System werden dieselben Antwort- und Bewertungsmodelle verwendet. Systeme, die nicht dasselbe Prüfprotokoll erfüllen, werden separat dokumentiert statt in die Rangliste gemischt.
So lesen Sie die beiden Tabellen