የህዝብ benchmark

የEngram መለኪያ ዘዴ

ከታተሙት ውጤቶች በስተጀርባ ያሉትን ክፍት የውሂብ ስብስቦች፣ የፍለጋ መለኪያዎች፣ የመልስ ምርመራዎች፣ መነሻዎች፣ ገደቦች እና የአቤቱታ ደንቦች ይመልከቱ።

የLoCoMo ማስረጃ ፍለጋ92.19%
የLoCoMo መልስ ግምገማ66.33%
እንዴት ይሠራል
01

የLoCoMo ማስረጃ ፍለጋ

ሙሉ public run። Scores የሚያሳዩት የሚፈለገው source evidence በተመለሱ memories ውስጥ እንዳለ ነው።

02

የLoCoMo መልስ ግምገማ

በተመሳሳይ 98 ተግባራት ላይ Codex/self-review የተገመገመ ምርመራ። ከተመለሰው context የተፈጠረው መልስ ትክክል ነው ወይ ይለካል።

03

R@200 እና Top-200 እንዴት ይነበባሉ?

Evidence retrieval cumulative ነው፤ R@200 የR@50 ያገኘውን እና ተጨማሪ evidence ይይዛል፣ ስለዚህ ዝቅ መሆን አይገባውም። Answer accuracy ግን የተለየ ነው። ብዙ context noise ወይም conflicting memories ሊያመጣ ይችላል፤ Top-50 አንዳንዴ ንጹህ መልስ ይሰጣል፣ Top-200 ግን packaging ብዙ evidence ሲመጣም ይረዳ እንደሆነ ይፈትናል።

1,536

የተመዘኑ evidence-retrieval ጥያቄዎች

92.19%

Engram R@50

66.33%

ከtop-50 context የመልስ ትክክለኛነት

Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።

LoCoMo ↗

Engramን በሁለት መንገድ እንለካለን፡ ትክክለኛ evidence ያገኛል? LLM ከዚያ context ትክክለኛ መልስ ይሰጣል?

Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።

ድጋፍ እና አስተያየት

Engramን እንድናሻሽል ይርዱን

Setup ካስቸገረ፣ tool በልዩ ሁኔታ ካሰራ፣ ወይም pricing limit ትክክል ካልመሰለ እዚህ ይጻፉ። Message በቀጥታ ወደ እኛ ይመጣል።

ድጋፍ እና አስተያየት

ምን እናሻሽል?

Bugs, confusing setup steps, pricing questions እና product ideas በቀጥታ ወደ Engram team ይደርሳሉ።

10 ቁምፊዎች ያስፈልጋሉ0/10