معيار عام
مقاس على مهام ذاكرة حقيقية باختبارين
نقيس Engram بطريقتين: هل يسترجع الدليل الصحيح، وهل يستطيع النموذج الإجابة بدقة من ذلك السياق.
نفصل بين استرجاع الأدلة ودقة الإجابة. كلاهما يستخدم LoCoMo العام، لكنهما يقيسان مرحلتين مختلفتين من حلقة الذاكرة.
استرجاع أدلة LoCoMo
تشغيل عام كامل. توضح الدرجات هل يظهر الدليل المطلوب ضمن الذكريات المسترجعة.
| النظام | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
تقييم إجابات LoCoMo
يستخدم كل صف المجموعة الكاملة من 1,536 مهمة ذات أدلة وحد top-50 نفسه. أنشأ Codex الإجابات وقيّمها حكم منفصل لا يرى اسم النظام. هذا تشخيص أجرته Engram، وليس ترتيب LoCoMo رسميًا.
| النظام | صحيح / N | إجابة top-50 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
كيف نقرأ الجدولين
يستخدم التقييمان المنشوران جميع المهام ذات الأدلة البالغ عددها 1,536. يتطلب استرجاع الأدلة معرّفات المصدر، وتستخدم جميع الأنظمة المدرجة نماذج الإجابة والتحكيم نفسها. الأنظمة التي لا تحقق عقد التقييم نفسه توثق منفصلة ولا تخلط بالتصنيف.
كيف نقرأ الجدولين