معيار عام

مقاس على مهام ذاكرة حقيقية باختبارين

نقيس Engram بطريقتين: هل يسترجع الدليل الصحيح، وهل يستطيع النموذج الإجابة بدقة من ذلك السياق.

نفصل بين استرجاع الأدلة ودقة الإجابة. كلاهما يستخدم LoCoMo العام، لكنهما يقيسان مرحلتين مختلفتين من حلقة الذاكرة.

1,536
أسئلة استرجاع أدلة مقيمة
92.19%
Engram R@50
66.33%
دقة الإجابة من سياق top-50
+8.21pp
تفوق R@50 على LangMem

استرجاع أدلة LoCoMo

تشغيل عام كامل. توضح الدرجات هل يظهر الدليل المطلوب ضمن الذكريات المسترجعة.

+8.21pp فوق ثاني أفضل R@50N=1,536
النظامMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

تقييم إجابات LoCoMo

تشخيص بمراجعة Codex/self-review على نفس 98 مهمة. يقيس هل الإجابة الناتجة من السياق المسترجع صحيحة.

N=98
النظامإجابة top-50إجابة top-200مقابل النموذج الأساسي
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

كيف نقرأ R@200 وTop-200

استرجاع الأدلة تراكمي: R@200 يحتوي ما وجده R@50 وأكثر، لذلك لا يفترض أن يكون أقل. دقة الإجابة مختلفة. المزيد من السياق قد يجلب ضجيجًا أو ذكريات متعارضة؛ Top-50 قد يعطي جوابًا أنظف، وTop-200 يختبر هل يبقى تغليف السياق مفيدًا مع أدلة أكثر.

الدعم والملاحظات

ساعدنا في تحسين Engram

إذا كان الإعداد مربكًا، أو تصرفت أداة بشكل غريب، أو بدا حد السعر غير صحيح، اكتب لنا هنا. تصل الرسالة مباشرة إلينا.

الدعم والملاحظات

ما الذي نحسّنه؟

الأخطاء وخطوات الإعداد المربكة وأسئلة الأسعار وأفكار المنتج تصل مباشرة إلى فريق Engram.

باقي 10 أحرف0/10