衡量完整的记忆闭环。

FishMem 公开测试框架、冻结配置、artifact hash、置信区间与限制,帮助团队质疑每项结论,并建立自己的发布门槛。

全量配对结果

2026-08-24 冻结运行在每道题上对 FishMem 与 mem0 OSS 3.1.2 进行配对比较。500 道 LongMemEval oracle 中,FishMem 为 88.2%,mem0 为 83.8%;400 道 BEAM 100K 中,两者分别为 46.7% 与 41.0%。

LoCoMo 是败项:类别 1–5 共 1,986 道配对题中,FishMem 为 67.5%,mem0 为 71.1%。这项统计显著的负结果仍参与发布判断。

  • LongMemEval:+4.4 pt,95% CI +1.0 至 +7.8
  • BEAM:+5.7 pt,95% CI +1.8 至 +9.5
  • LoCoMo:−3.7 pt,95% CI −5.8 至 −1.5
  • 每组使用相同输入与公开配置

这些结果不能证明什么

LongMemEval oracle 不是 LongMemEval-S,不能据此声称超过人类。由于运行中存在中断后恢复的进程,本次总成本与端到端总耗时不满足发布条件。

FishMem 在 LongMemEval 与 BEAM 中召回的上下文也显著多于 mem0。冻结协议下的质量胜项成立,但不能外推成普遍的准确率、速度、成本或 token 效率优势。

使用测试框架,而不是只看标题

公共数据集能暴露问题类别,但你的用户、写入策略、作用域、模型供应商和答案标准会不同。应冻结有代表性的产品轨迹,同时评估持久化状态与下游答案,并保留独立发布集。

检查 benchmark 运行器