LoCoMo में प्रमाण खोज
पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।
पब्लिक benchmark
Engram के published results के पीछे public datasets, retrieval metrics, answer checks, baselines, limitations और claim rules देखें।
पूरा public run। Scores बताते हैं कि जरूरी source evidence retrieved memories में आया या नहीं।
उन्हीं 98 tasks पर Codex/self-review diagnostic। यह देखता है कि retrieved context से generated answer सही है या नहीं।
Evidence retrieval cumulative होता है: R@200 में R@50 वाली evidence और उससे ज़्यादा शामिल हो सकती है, इसलिए यह कम नहीं होना चाहिए. Answer accuracy अलग है. ज़्यादा context noise या conflicting memories भी ला सकता है; Top-50 कभी-कभी साफ जवाब देता है, जबकि Top-200 जाँचता है कि ज्यादा evidence के साथ packaging useful रहती है या नहीं.
scored evidence-retrieval questions
Engram R@50
top-50 context से answer accuracy
Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।
LoCoMo ↗Evidence retrieval और answer accuracy अलग रखे गए हैं। दोनों public LoCoMo पर चलते हैं, लेकिन memory loop के अलग हिस्से मापते हैं।
सपोर्ट और फीडबैक
अगर setup confusing है, कोई tool अजीब behave करता है, या pricing limit गलत लगती है, यहाँ लिखें. Message सीधे हम तक आएगा.