पब्लिक benchmark

वास्तविक memory tasks पर मापा गया दो जांचों से

हम Engram को दो तरीकों से मापते हैं: क्या सही evidence मिलता है, और क्या LLM उस context से सही जवाब दे पाता है।

Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।

1,536
scored evidence-retrieval questions
92.19%
Engram R@50
66.33%
top-50 context से answer accuracy
+8.21pp
LangMem पर R@50 lead

LoCoMo में प्रमाण खोज

पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।

R@50 में दूसरे से +8.21pp आगेN=1,536
SystemMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

LoCoMo में जवाब की जांच

उन्हीं 98 tasks पर Codex/self-review diagnostic। यह देखता है कि retrieved context से generated answer सही है या नहीं।

N=98
SystemTop-50 answerTop-200 answerbase model से तुलना
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

R@200 और Top-200 कैसे पढ़ें

Evidence retrieval cumulative होता है: R@200 में R@50 वाली evidence और उससे ज़्यादा शामिल हो सकती है, इसलिए यह कम नहीं होना चाहिए. Answer accuracy अलग है. ज़्यादा context noise या conflicting memories भी ला सकता है; Top-50 कभी-कभी साफ जवाब देता है, जबकि Top-200 जाँचता है कि ज्यादा evidence के साथ packaging useful रहती है या नहीं.

सपोर्ट और फीडबैक

Engram को बेहतर बनाने में मदद करें

अगर setup confusing है, कोई tool अजीब behave करता है, या pricing limit गलत लगती है, यहाँ लिखें. Message सीधे हम तक आएगा.

सपोर्ट और फीडबैक

हम क्या सुधारें?

Bugs, confusing setup steps, pricing questions और product ideas सीधे Engram team तक जाते हैं.

10 और अक्षर चाहिए0/10