የህዝብ benchmark
በእውነተኛ memory tasks ላይ ተለክቷል በሁለት መፈተኛዎች
Engramን በሁለት መንገድ እንለካለን፡ ትክክለኛ evidence ያገኛል? LLM ከዚያ context ትክክለኛ መልስ ይሰጣል?
Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።
1,536
የተመዘኑ evidence-retrieval ጥያቄዎች
92.19%
Engram R@50
66.33%
ከtop-50 context የመልስ ትክክለኛነት
+8.21pp
ከLangMem በላይ R@50 ጥቅም
የLoCoMo ማስረጃ ፍለጋ
ሙሉ public run። Scores የሚያሳዩት የሚፈለገው source evidence በተመለሱ memories ውስጥ እንዳለ ነው።
+8.21pp ከሁለተኛ R@50 በላይN=1,536
| ስርዓት | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
የLoCoMo መልስ ግምገማ
በተመሳሳይ 98 ተግባራት ላይ Codex/self-review የተገመገመ ምርመራ። ከተመለሰው context የተፈጠረው መልስ ትክክል ነው ወይ ይለካል።
| ስርዓት | Top-50 መልስ | Top-200 መልስ | ከመሠረታዊ model ጋር |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
?
R@200 እና Top-200 እንዴት ይነበባሉ?
Evidence retrieval cumulative ነው፤ R@200 የR@50 ያገኘውን እና ተጨማሪ evidence ይይዛል፣ ስለዚህ ዝቅ መሆን አይገባውም። Answer accuracy ግን የተለየ ነው። ብዙ context noise ወይም conflicting memories ሊያመጣ ይችላል፤ Top-50 አንዳንዴ ንጹህ መልስ ይሰጣል፣ Top-200 ግን packaging ብዙ evidence ሲመጣም ይረዳ እንደሆነ ይፈትናል።