पब्लिक benchmark
वास्तविक memory tasks पर मापा गया दो जांचों से
हम Engram को दो तरीकों से मापते हैं: क्या सही evidence मिलता है, और क्या LLM उस context से सही जवाब दे पाता है।
Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।
LoCoMo में प्रमाण खोज
पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।
| System | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo में जवाब की जांच
हर पंक्ति में evidence वाले सभी 1,536 tasks और वही top-50 सीमा है। Codex ने जवाब बनाए और एक अलग blind judge ने उन्हें score किया। यह Engram द्वारा चलाया गया diagnostic है, आधिकारिक LoCoMo leaderboard नहीं।
| System | सही / N | Top-50 answer |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
दोनों तालिकाएँ कैसे पढ़ें
दोनों प्रकाशित evaluations evidence वाले सभी 1,536 tasks पर चलते हैं। Evidence retrieval को source IDs चाहिए और शामिल हर system के लिए वही answer और judge models उपयोग होते हैं। जो system समान evaluation contract पूरा नहीं करते, उन्हें ranking में मिलाने के बजाय अलग दर्ज किया जाता है।
दोनों तालिकाएँ कैसे पढ़ें