LoCoMo Evidenz-Retrieval
Vollständiger öffentlicher Lauf. Die Scores zeigen, ob die benötigte Quelle in den abgerufenen Memories erscheint.
Öffentlicher Benchmark
Sehen Sie öffentliche Datensätze, Retrieval-Metriken, Antwortprüfungen, Baselines, Grenzen und Regeln hinter den veröffentlichten Ergebnissen.
Vollständiger öffentlicher Lauf. Die Scores zeigen, ob die benötigte Quelle in den abgerufenen Memories erscheint.
Codex/self-review-Diagnose auf denselben 98 Aufgaben. Bewertet, ob die generierte Antwort aus dem abgerufenen Kontext korrekt ist.
Evidence Retrieval ist kumulativ: R@200 enthält alles aus R@50 plus mehr, sollte also nicht niedriger sein. Antwortgenauigkeit ist anders. Mehr Kontext kann auch Noise oder widersprüchliche Memories bringen; Top-50 antwortet manchmal sauberer, Top-200 testet, ob das Packaging mit mehr Evidence noch nützlich bleibt.
bewertete Retrieval-Fragen
Engram R@50
Antwortgenauigkeit aus Top-50-Kontext
Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.
LoCoMo ↗Evidenz-Retrieval und Antwortgenauigkeit bleiben getrennt. Beide nutzen öffentliches LoCoMo, messen aber unterschiedliche Teile der Memory-Schleife.
Support und Feedback
Wenn Setup verwirrend ist, ein Tool seltsam reagiert oder ein Preislimit falsch wirkt, schreib uns hier. Die Nachricht landet direkt bei uns.