全量配对结果
2026-08-24 冻结运行在每道题上对 FishMem 与 mem0 OSS 3.1.2 进行配对比较。500 道 LongMemEval oracle 中,FishMem 为 88.2%,mem0 为 83.8%;400 道 BEAM 100K 中,两者分别为 46.7% 与 41.0%。
LoCoMo 是败项:类别 1–5 共 1,986 道配对题中,FishMem 为 67.5%,mem0 为 71.1%。这项统计显著的负结果仍参与发布判断。
- LongMemEval:+4.4 pt,95% CI +1.0 至 +7.8
- BEAM:+5.7 pt,95% CI +1.8 至 +9.5
- LoCoMo:−3.7 pt,95% CI −5.8 至 −1.5
- 每组使用相同输入与公开配置
这些结果不能证明什么
LongMemEval oracle 不是 LongMemEval-S,不能据此声称超过人类。由于运行中存在中断后恢复的进程,本次总成本与端到端总耗时不满足发布条件。
FishMem 在 LongMemEval 与 BEAM 中召回的上下文也显著多于 mem0。冻结协议下的质量胜项成立,但不能外推成普遍的准确率、速度、成本或 token 效率优势。
使用测试框架,而不是只看标题
公共数据集能暴露问题类别,但你的用户、写入策略、作用域、模型供应商和答案标准会不同。应冻结有代表性的产品轨迹,同时评估持久化状态与下游答案,并保留独立发布集。
检查 benchmark 运行器