- 01保留创建元数据、上传精确字节并验证长度与 SHA-256。
- 02提取运行持久 Docling 任务,保留 Markdown 与无损结构。
- 03索引只提交一次 Document,再生成确定性分块与向量。
- 0125 MB 文件限制
- 02300 页限制
- 03不可变来源字节
- 04可引用分块
原始来源保持权威;提取、切分、嵌入和检索都是可复现的投影。
把知识文件和用户事实分开。
文档拥有独立资源、生命周期与搜索面。手册或合同保持完整,记忆则继续承担关于人、智能体和状态的精炼记录。
- 直接文本与上传文件汇入同一规范 DocumentCorpus 写入器。
- source_key 让替换和来源家族删除保持显式。
- 无需语义搜索也能读取精确内容。
每个慢步骤都有状态。
上传会经过等待、已上传、排队、处理中与最终状态。任务行负责重试,队列和容器只负责唤醒工作。
- 创建、上传与完成都能独立重试。
- 校验和阻止相同身份被不同字节替换。
- 重试、取消、超时与死信行为都有明确操作。
返回上下文,也返回它的来源。
文档搜索把命中分块与所属文档一起返回。相邻扩展恢复周边上下文,又不会把摘录伪装成完整来源。
- 作用域与 source_key 过滤阻止跨语料检索。
- 文档内容返回可检查的规范 Markdown。
- 删除文档会有意移除其来源家族与关联投影。
从一个具体请求开始。
const source = await fishmem.documents.upload(
{
file: new Blob([bytes], { type: "application/pdf" }),
filename: "product-handbook.pdf",
user_id: "alex",
source_key: "handbook/product.pdf"
},
{ idempotencyKey: "handbook-v4" }
);这个产品范围包含什么
- PDF、Office、OpenDocument、EPUB、邮件、图片、JSON、XML、YAML 与文本。
- 不可变上传、校验和、提取产物、确定性分块与文档搜索。
- 桌面版提供本地直接文本路径,云端提供托管文件提取。
明确边界
- 二进制上传与 Docling 提取属于云端和自托管控制面,不是隐藏的桌面服务。
- 云端提取后向量可见性是异步的;精确元数据与内容会先可用。
- OCR 质量取决于来源质量和固定的提取运行时。
