የህዝብ benchmark

በእውነተኛ memory tasks ላይ ተለክቷል በሁለት መፈተኛዎች

Engramን በሁለት መንገድ እንለካለን፡ ትክክለኛ evidence ያገኛል? LLM ከዚያ context ትክክለኛ መልስ ይሰጣል?

Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።

1,536
የተመዘኑ evidence-retrieval ጥያቄዎች
92.19%
Engram R@50
66.33%
ከtop-50 context የመልስ ትክክለኛነት
+8.21pp
ከLangMem በላይ R@50 ጥቅም

የLoCoMo ማስረጃ ፍለጋ

ሙሉ public run። Scores የሚያሳዩት የሚፈለገው source evidence በተመለሱ memories ውስጥ እንዳለ ነው።

+8.21pp ከሁለተኛ R@50 በላይN=1,536
ስርዓትMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

የLoCoMo መልስ ግምገማ

በተመሳሳይ 98 ተግባራት ላይ Codex/self-review የተገመገመ ምርመራ። ከተመለሰው context የተፈጠረው መልስ ትክክል ነው ወይ ይለካል።

N=98
ስርዓትTop-50 መልስTop-200 መልስከመሠረታዊ model ጋር
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

R@200 እና Top-200 እንዴት ይነበባሉ?

Evidence retrieval cumulative ነው፤ R@200 የR@50 ያገኘውን እና ተጨማሪ evidence ይይዛል፣ ስለዚህ ዝቅ መሆን አይገባውም። Answer accuracy ግን የተለየ ነው። ብዙ context noise ወይም conflicting memories ሊያመጣ ይችላል፤ Top-50 አንዳንዴ ንጹህ መልስ ይሰጣል፣ Top-200 ግን packaging ብዙ evidence ሲመጣም ይረዳ እንደሆነ ይፈትናል።

ድጋፍ እና አስተያየት

Engramን እንድናሻሽል ይርዱን

Setup ካስቸገረ፣ tool በልዩ ሁኔታ ካሰራ፣ ወይም pricing limit ትክክል ካልመሰለ እዚህ ይጻፉ። Message በቀጥታ ወደ እኛ ይመጣል።

ድጋፍ እና አስተያየት

ምን እናሻሽል?

Bugs, confusing setup steps, pricing questions እና product ideas በቀጥታ ወደ Engram team ይደርሳሉ።

10 ቁምፊዎች ያስፈልጋሉ0/10