पब्लिक benchmark
वास्तविक memory tasks पर मापा गया दो जांचों से
हम Engram को दो तरीकों से मापते हैं: क्या सही evidence मिलता है, और क्या LLM उस context से सही जवाब दे पाता है।
Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।
LoCoMo में प्रमाण खोज
पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।
| System | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo में जवाब की जांच
उन्हीं 98 tasks पर Codex/self-review diagnostic। यह देखता है कि retrieved context से generated answer सही है या नहीं।
| System | Top-50 answer | Top-200 answer | base model से तुलना |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
R@200 और Top-200 कैसे पढ़ें
Evidence retrieval cumulative होता है: R@200 में R@50 वाली evidence और उससे ज़्यादा शामिल हो सकती है, इसलिए यह कम नहीं होना चाहिए. Answer accuracy अलग है. ज़्यादा context noise या conflicting memories भी ला सकता है; Top-50 कभी-कभी साफ जवाब देता है, जबकि Top-200 जाँचता है कि ज्यादा evidence के साथ packaging useful रहती है या नहीं.