معيار عام
مقاس على مهام ذاكرة حقيقية باختبارين
نقيس Engram بطريقتين: هل يسترجع الدليل الصحيح، وهل يستطيع النموذج الإجابة بدقة من ذلك السياق.
نفصل بين استرجاع الأدلة ودقة الإجابة. كلاهما يستخدم LoCoMo العام، لكنهما يقيسان مرحلتين مختلفتين من حلقة الذاكرة.
استرجاع أدلة LoCoMo
تشغيل عام كامل. توضح الدرجات هل يظهر الدليل المطلوب ضمن الذكريات المسترجعة.
| النظام | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
تقييم إجابات LoCoMo
تشخيص بمراجعة Codex/self-review على نفس 98 مهمة. يقيس هل الإجابة الناتجة من السياق المسترجع صحيحة.
| النظام | إجابة top-50 | إجابة top-200 | مقابل النموذج الأساسي |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
كيف نقرأ R@200 وTop-200
استرجاع الأدلة تراكمي: R@200 يحتوي ما وجده R@50 وأكثر، لذلك لا يفترض أن يكون أقل. دقة الإجابة مختلفة. المزيد من السياق قد يجلب ضجيجًا أو ذكريات متعارضة؛ Top-50 قد يعطي جوابًا أنظف، وTop-200 يختبر هل يبقى تغليف السياق مفيدًا مع أدلة أكثر.