पब्लिक benchmark

Engram benchmark methodology

Engram के published results के पीछे public datasets, retrieval metrics, answer checks, baselines, limitations और claim rules देखें।

LoCoMo में प्रमाण खोज92.19%
LoCoMo में जवाब की जांच66.33%
कैसे काम करता है
01

LoCoMo में प्रमाण खोज

पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।

02

LoCoMo में जवाब की जांच

उन्हीं 98 tasks पर Codex/self-review diagnostic। यह देखता है कि retrieved context से generated answer सही है या नहीं।

03

R@200 और Top-200 कैसे पढ़ें

Evidence retrieval cumulative होता है: R@200 में R@50 वाली evidence और उससे ज़्यादा शामिल हो सकती है, इसलिए यह कम नहीं होना चाहिए. Answer accuracy अलग है. ज़्यादा context noise या conflicting memories भी ला सकता है; Top-50 कभी-कभी साफ जवाब देता है, जबकि Top-200 जाँचता है कि ज्यादा evidence के साथ packaging useful रहती है या नहीं.

1,536

scored evidence-retrieval questions

92.19%

Engram R@50

66.33%

top-50 context से answer accuracy

Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।

LoCoMo ↗

हम Engram को दो तरीकों से मापते हैं: क्या सही evidence मिलता है, और क्या LLM उस context से सही जवाब दे पाता है।

Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।

सपोर्ट और फीडबैक

Engram को बेहतर बनाने में मदद करें

अगर setup confusing है, कोई tool अजीब behave करता है, या pricing limit गलत लगती है, यहाँ लिखें. Message सीधे हम तक आएगा.

सपोर्ट और फीडबैक

हम क्या सुधारें?

Bugs, confusing setup steps, pricing questions और product ideas सीधे Engram team तक जाते हैं.

10 और अक्षर चाहिए0/10