पब्लिक benchmark

वास्तविक memory tasks पर मापा गया दो जांचों से

हम Engram को दो तरीकों से मापते हैं: क्या सही evidence मिलता है, और क्या LLM उस context से सही जवाब दे पाता है।

Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।

1,536
scored evidence-retrieval questions
93.29%
Engram R@50
89.65%
top-50 context से answer accuracy
+8.13pp
दूसरे सर्वश्रेष्ठ सिस्टम पर R@50 बढ़त

LoCoMo में प्रमाण खोज

पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।

R@50 में दूसरे से +8.13pp आगेN=1,536
SystemMRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

LoCoMo में जवाब की जांच

हर पंक्ति में evidence वाले सभी 1,536 tasks और वही top-50 सीमा है। Codex ने जवाब बनाए और एक अलग blind judge ने उन्हें score किया। यह Engram द्वारा चलाया गया diagnostic है, आधिकारिक LoCoMo leaderboard नहीं।

N=1,536
Systemसही / NTop-50 answer
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

दोनों तालिकाएँ कैसे पढ़ें

दोनों प्रकाशित evaluations evidence वाले सभी 1,536 tasks पर चलते हैं। Evidence retrieval को source IDs चाहिए और शामिल हर system के लिए वही answer और judge models उपयोग होते हैं। जो system समान evaluation contract पूरा नहीं करते, उन्हें ranking में मिलाने के बजाय अलग दर्ज किया जाता है।

दोनों तालिकाएँ कैसे पढ़ें

सपोर्ट और फीडबैक

Engram को बेहतर बनाने में मदद करें

अगर setup confusing है, कोई tool अजीब behave करता है, या pricing limit गलत लगती है, यहाँ लिखें. Message सीधे हम तक आएगा.

सपोर्ट और फीडबैक

हम क्या सुधारें?

Bugs, confusing setup steps, pricing questions और product ideas सीधे Engram team तक जाते हैं.

10 और अक्षर चाहिए0/10