PrivyPDF:从 PDF 阅读工具到本地优先的 PDF Agent

PDF 是工作、学习和研究中最常见的文档格式之一。

合同、论文、财务报告、产品文档、扫描件、会议材料、说明书和电子书,最终往往都会以 PDF 的形式保存。但传统 PDF 工具主要解决的是“打开、阅读和编辑”,用户仍然需要自己完成信息定位、内容理解、知识整理和后续处理。

PrivyPDF 希望重新定义 PDF 的使用方式。它面向 iOS 与 macOS;可从 PrivyPDF 产品官网 了解产品。

它不只是一个 PDF 阅读器,也不只是一个 OCR 或文档问答工具,而是一套面向 iOS 和 macOS 的本地优先 PDF 智能工作平台。PrivyPDF 将 PDF 扫描、导入、OCR、结构化、检索、理解、编辑和 Agent 自动化整合到一个统一流程中,让 PDF 从静态文件转变为可以被理解、检索和操作的知识载体。

PrivyPDF 的核心目标可以概括为:

让用户不仅能够阅读 PDF,还能够让 AI 理解 PDF、分析 PDF,并围绕 PDF 完成实际任务。

一、为什么需要一个 PDF Agent

传统 PDF 应用通常集中在以下能力:

  • 打开和阅读 PDF
  • 搜索关键词
  • 添加批注和高亮
  • 合并或拆分文件
  • 填写表单
  • 修改页面或文本
  • 将扫描件转换为可搜索文档

这些功能依然重要,但它们解决的主要是“文件操作”问题,而不是“内容处理”问题。

面对一份几十页甚至几百页的文档,用户真正关心的通常是:

  • 这份文档主要讲了什么?
  • 哪些内容与我当前的问题有关?
  • 某个结论出现在什么位置?
  • 文档中有哪些重要数字、人物、日期和条款?
  • 多份 PDF 之间有什么联系或冲突?
  • 扫描件中的文字能否被准确识别?
  • 能否自动整理为摘要、笔记或结构化数据?
  • 能否基于文档内容继续执行下一步任务?

传统 PDF 阅读器要求用户主动搜索、翻页和整理,而 PDF Agent 则可以主动理解用户目标,规划处理步骤,并调用 OCR、检索、模型推理和 PDF 编辑能力完成任务。

因此,PrivyPDF 的产品定位不是“给 PDF 增加一个聊天窗口”,而是围绕 PDF 构建一个完整的智能处理系统。

二、PrivyPDF 的整体产品定位

PrivyPDF 面向两个主要使用环境。

iOS:随时捕获、扫描和理解文档

在移动端,PDF 往往来自现实世界和即时场景:

  • 使用摄像头扫描纸质文件
  • 从邮件或聊天应用导入附件
  • 从 Safari 下载报告
  • 从“文件”应用选择 PDF
  • 扫描票据、合同、说明书或课堂材料
  • 在通勤或会议中快速理解文档

因此,iOS 版本的核心不是复杂编辑,而是:

快速把现实世界中的文档变成可理解、可搜索、可提问的数字内容。

完整流程包括:

flowchart TD
    A["拍摄或导入"] --> B["图像校正与页面处理"]
    B --> C["OCR 文字识别"]
    C --> D["文档结构分析"]
    D --> E["内容摘要与理解"]
    E --> F["问答、提取与导出"]

macOS:构建完整的 PDF 知识工作流

在桌面端,用户通常需要处理更复杂、更长时间跨度的任务:

  • 阅读长篇论文和报告
  • 分析合同或技术文档
  • 管理大量本地 PDF
  • 对扫描件进行批量 OCR
  • 建立文档知识库
  • 基于多份 PDF 进行检索和问答
  • 修改、重组或导出文档
  • 让 Agent 执行多步骤文档任务

因此,macOS 版本的核心是:

将 PDF 转化为本地知识库,并通过 Agent 完成检索、分析、编辑和知识生产。

完整流程包括:

flowchart TD
    A["PDF 导入"] --> B["文档解析"]
    B --> C["OCR 与版面识别"]
    C --> D["文本分块与向量化"]
    D --> E["建立本地 RAG 索引"]
    E --> F["内容理解与跨文档检索"]
    F --> G["PDF 编辑与结果导出"]
    G --> H["Agent 自动执行任务"]

iOS 和 macOS 并不是两个独立产品,而是同一个 PDF Agent 在不同设备上的能力延伸。

三、PrivyPDF for iOS:从扫描到理解

1. 使用摄像头扫描纸质文档

很多重要内容仍然存在于纸张之中,例如:

  • 纸质合同
  • 学校资料
  • 医疗或保险文件
  • 产品说明书
  • 会议白板
  • 收据与账单
  • 手写或打印笔记

PrivyPDF 可以通过 iPhone 摄像头完成文档扫描。

扫描过程不仅是拍照,还包括:

  • 自动检测页面边缘
  • 透视校正
  • 页面裁剪
  • 亮度和对比度优化
  • 阴影与背景处理
  • 多页连续扫描
  • 页面方向识别
  • 扫描结果预览和调整

处理后的页面可以直接生成 PDF,也可以继续进入 OCR 和文档理解流程。

用户不需要先使用扫描应用生成 PDF,再切换到其他 AI 工具分析。扫描、识别和理解可以在 PrivyPDF 内部连续完成。

2. 从系统和其他应用导入 PDF

除扫描外,PrivyPDF 还可以承接来自 iOS 系统中的各种 PDF 文件。

典型入口包括:

  • 从“文件”应用导入
  • 从 iCloud Drive 导入
  • 从邮件附件打开
  • 从 Safari 下载后打开
  • 通过系统分享菜单发送到 PrivyPDF
  • 从其他即时通信或办公应用导入
  • 从相册导入文档图片

这种设计让 PrivyPDF 成为 iOS 上统一的 PDF 智能处理入口。

用户看到一份需要分析的文档时,可以直接选择“使用 PrivyPDF 打开”,而不必先移动文件或调整格式。

3. 移动端 OCR

很多 PDF 实际上并不包含可选中的文本。

例如扫描生成的 PDF,本质上只是一组图片。传统关键词搜索、复制和 AI 分析都无法直接处理这些内容。

PrivyPDF 可以对页面执行 OCR,将图像中的文字转换为可检索文本。

OCR 流程包括:

  1. 页面图像预处理
  2. 文字区域检测
  3. 文本识别
  4. 阅读顺序恢复
  5. 段落和页面结构重建
  6. OCR 结果与原始页面位置关联

完成 OCR 后,用户可以:

  • 搜索扫描件中的文字
  • 复制识别后的内容
  • 对扫描文件进行总结
  • 询问某个条款或段落
  • 提取日期、金额和名称
  • 将识别结果导出为 Markdown、Word 或结构化数据

PrivyPDF 的目标不是只输出一份纯文本,而是尽可能保留文字与原始页面之间的对应关系。

这样,当 AI 给出回答时,用户仍然可以回到原始页面核对内容。

4. PDF 摘要与快速理解

在移动设备上,用户通常没有足够时间逐页阅读长文档。

PrivyPDF 可以根据 PDF 内容生成不同层级的摘要:

  • 一句话摘要
  • 核心观点摘要
  • 分章节摘要
  • 关键结论列表
  • 重要数字与日期
  • 风险和注意事项
  • 面向特定目标的定向摘要

例如,对于一份产品说明书,用户可以要求:

告诉我这份说明书中最重要的安装步骤和安全注意事项。

对于一份合同,可以要求:

总结付款、续约、终止和违约相关的条款。

对于一篇论文,可以要求:

解释研究问题、方法、实验结果和局限性。

PrivyPDF 不只是压缩文档长度,而是根据用户的真实目标重新组织文档信息。

5. 基于 PDF 的问答

用户可以直接围绕当前 PDF 提问,例如:

  • 这份文档的主要结论是什么?
  • 第三章解决了什么问题?
  • 合同的终止条件是什么?
  • 文件中提到了哪些时间节点?
  • 作者使用了什么实验方法?
  • 这份报告有哪些潜在风险?
  • 哪些内容与数据隐私有关?
  • 帮我解释这一页中的专业术语。

回答可以关联到具体页面或文本片段,使用户能够查看答案来源。

这与普通聊天模型的区别在于,PrivyPDF 的回答基于用户导入的真实文档,而不是仅依赖模型自身知识。

6. 信息提取

除了总结和问答,移动端还适合快速提取信息。

PrivyPDF 可以从文档中识别并整理:

  • 姓名
  • 公司名称
  • 地址
  • 日期
  • 金额
  • 账户信息
  • 合同条款
  • 产品型号
  • 参考文献
  • 表格内容
  • 待办事项
  • 联系方式

提取结果可以转换为结构化格式,方便用户复制、保存或发送到其他应用。

例如,从一份发票中提取:

{
  "invoiceNumber": "INV-2026-0012",
  "date": "2026-07-20",
  "vendor": "Example Company",
  "total": "SGD 1,280.00"
}

从会议材料中提取:

  • 决策事项
  • 负责人
  • 截止日期
  • 风险项
  • 后续行动

这使 PrivyPDF 从阅读工具进一步转变为信息处理工具。

四、PrivyPDF for macOS:从 PDF 到本地知识库

1. 多种 PDF 导入方式

macOS 版本可以处理更加完整的桌面文件工作流。

用户可以通过以下方式导入文档:

  • 拖拽 PDF 到应用
  • 选择本地文件
  • 导入整个文件夹
  • 从 Finder 使用“打开方式”
  • 通过系统分享菜单导入
  • 批量导入多份 PDF
  • 监听指定文档目录

导入后,PrivyPDF 会建立文档记录,并进入解析、OCR 和索引流程。

对于已经包含文本层的 PDF,可以直接提取内容;对于扫描 PDF,则自动或按需执行 OCR。

2. PDF 文档解析

PDF 是一种面向页面展示的格式,而不是天然适合语义理解的文档格式。

页面中的文本可能被拆分为大量独立字符或文本块,阅读顺序也不一定与视觉顺序一致。此外,PDF 还可能包含:

  • 多栏排版
  • 页眉和页脚
  • 脚注
  • 表格
  • 图片
  • 公式
  • 注释
  • 扫描页面
  • 混合语言内容

PrivyPDF 在导入后需要先建立文档的内部表示,包括:

  • 页面
  • 文本块
  • 段落
  • 标题
  • 章节
  • 表格
  • 图像
  • 注释
  • 页面坐标
  • 文档元数据

这个内部结构是后续 OCR、RAG、问答和编辑能力的基础。

3. OCR 与扫描文档处理

macOS 版本支持更完整的 OCR 工作流。

用户可以对单页、指定页面或整份文档执行 OCR,也可以批量处理多个扫描 PDF。

OCR 后,PrivyPDF 可以生成:

  • 可搜索文本层
  • 页面级识别结果
  • 段落级文本
  • 文本坐标信息
  • OCR 置信度
  • 可复制内容
  • 可供 RAG 使用的结构化文本

对于识别质量较低的区域,可以保留原始图像和识别结果,方便后续校正。

OCR 不应被视为一个孤立功能,它是扫描 PDF 进入 AI 工作流的入口。

完成 OCR 后,原本不可搜索的扫描文件就可以参与:

  • 全文检索
  • 语义检索
  • 文档问答
  • 信息提取
  • 摘要生成
  • 跨文档分析

五、PDF 的 RAG 化

1. 什么是 PDF RAG

RAG,即 Retrieval-Augmented Generation,可以理解为“先检索文档,再让模型基于检索结果回答”。

如果直接把一整份长 PDF 发送给模型,会面临多个问题:

  • 文档可能超过模型上下文限制
  • 每次提问都需要重新处理大量文本
  • 推理速度慢
  • 计算和 API 成本高
  • 回答难以定位来源
  • 多份文档难以统一管理

PrivyPDF 会将 PDF 转换为可以被检索的本地知识库。

处理流程通常包括:

flowchart TD
    A["PDF"] --> B["文本与结构提取"]
    B --> C["内容清理"]
    C --> D["章节和语义分块"]
    D --> E["Embedding 向量生成"]
    E --> F["本地向量索引"]
    F --> G["关键词与语义混合检索"]
    G --> H["模型生成回答"]

这个过程可以称为 PDF 的“RAG 化”。

2. 文档分块

分块不是简单地按照固定字符数切割文本。

PrivyPDF 可以结合文档结构进行分块,例如:

  • 按标题和章节分块
  • 按段落分块
  • 按页面分块
  • 按表格分块
  • 按语义边界分块
  • 保留重叠上下文
  • 保留页面和坐标引用

每个内容块都可以携带元数据:

文档 ID
文件名
页码
章节
标题
内容类型
创建时间
OCR 状态
页面坐标

这些元数据可以帮助系统生成更加准确和可追溯的回答。

3. 本地向量索引

PrivyPDF 可以在本地生成并保存文档向量索引。

这意味着用户不需要每次提问时重新上传整份文档,也不必依赖远程云端知识库。

本地索引的优势包括:

  • 文档处理速度更快
  • 支持离线使用
  • 降低云端 API 成本
  • 减少隐私泄露风险
  • 支持长期管理大量文档
  • 可以跨文档搜索
  • 文档删除后可同步删除索引

对于隐私敏感的 PDF,例如合同、内部报告、个人材料和未公开研究文档,本地索引尤其重要。

4. 关键词与语义混合检索

纯关键词搜索要求用户准确知道文档中的原始表达。

例如,文档中使用的是“termination clause”,用户搜索“如何结束合同”,传统关键词搜索可能无法命中。

语义检索可以理解用户问题和文档表达之间的语义关系。

但纯语义检索也可能在精确数字、专有名词和代码等场景下表现不足。

因此,PrivyPDF 可以结合:

  • 关键词检索
  • 全文检索
  • 向量语义检索
  • 页面过滤
  • 文档过滤
  • 元数据过滤
  • 结果重排序

形成混合检索系统。

六、从单文档问答到多文档理解

PrivyPDF 不只处理单个 PDF,还可以围绕多个文档建立知识空间。

例如,用户可以导入:

  • 多篇同一研究方向的论文
  • 一个项目的全部技术文档
  • 多个版本的合同
  • 一组财务报告
  • 产品说明书和故障手册
  • 不同供应商的方案文档

然后进行跨文档分析:

  • 比较这些论文的方法和结论
  • 找出两个合同版本之间的变化
  • 总结不同报告中的共同风险
  • 对比多个产品的技术参数
  • 查找所有文档中关于某个主题的内容
  • 分析同一指标在不同年份的变化
  • 找出文档之间的冲突和不一致

这种能力让 PrivyPDF 从单文件工具转向本地文档知识库。

七、PDF 理解不只是聊天

许多 AI PDF 产品的交互方式是“上传 PDF,然后聊天”。

聊天是重要入口,但不是完整的产品形态。

PrivyPDF 希望把常见任务沉淀为明确能力。

文档摘要

  • 全文摘要
  • 章节摘要
  • 面向管理者的执行摘要
  • 面向研究人员的方法与结论摘要
  • 面向普通用户的简化解释

内容分析

  • 观点分析
  • 风险分析
  • 条款分析
  • 数据分析
  • 逻辑结构分析
  • 论据与结论分析
  • 文档完整性检查

信息提取

  • 实体提取
  • 表格提取
  • 日期和金额提取
  • 引用和参考文献提取
  • 行动项提取
  • 关键指标提取

文档转换

  • PDF 转 Markdown
  • PDF 转 Word
  • PDF 转纯文本
  • PDF 转 JSON
  • PDF 转结构化笔记
  • PDF 转问答卡片
  • PDF 转知识库内容

文档生成

  • 基于 PDF 生成报告
  • 基于论文生成阅读笔记
  • 基于合同生成审阅清单
  • 基于说明书生成操作指南
  • 基于多份文档生成对比报告

这些能力可以通过预设工作流使用,也可以由 PDF Agent 动态组合。

八、PDF 编辑能力

在 macOS 上,理解文档之后,用户往往还需要修改文档。

PrivyPDF 可以逐步整合常见 PDF 编辑能力:

  • 页面删除
  • 页面旋转
  • 页面排序
  • 页面拆分
  • 多文档合并
  • 页面提取
  • 添加文本
  • 添加批注
  • 添加高亮
  • 添加签名
  • 添加图片
  • 添加水印
  • 文本遮盖
  • 敏感信息脱敏
  • 表单填写
  • 元数据修改

更重要的是,编辑能力可以与 AI 理解结合。

例如用户可以提出:

  • 删除所有空白页面。
  • 把包含附件的页面提取为单独 PDF。
  • 高亮所有涉及付款义务的条款。
  • 找出个人信息并执行脱敏。
  • 将文档按章节拆分。
  • 为每一章添加书签。
  • 把 OCR 识别错误较多的页面列出来。
  • 提取所有图表并生成索引。
  • 删除页眉和页脚后导出文本。
  • 为文档生成目录并插入第一页。

传统 PDF 编辑器要求用户手动执行每一个操作,而 PDF Agent 可以先理解任务,再规划和执行操作。

九、PrivyPDF Agent

1. 什么是 PDF Agent

PDF Agent 是一个围绕文档目标执行多步骤任务的智能系统。

与普通问答不同,Agent 不只是生成一段文字,而是能够:

  1. 理解用户意图
  2. 检查当前文档状态
  3. 选择合适的工具
  4. 制定执行计划
  5. 调用 OCR、检索、分析或编辑能力
  6. 验证执行结果
  7. 向用户返回结果和来源

例如,用户输入:

分析这份合同,找出对我不利的条款,并生成一份修改建议。

PDF Agent 可以执行:

flowchart TD
    A["识别文档类型"] --> B["检查是否需要 OCR"]
    B --> C["提取合同结构"]
    C --> D["识别付款、责任、终止和争议条款"]
    D --> E["检索相关上下文"]
    E --> F["分析潜在风险"]
    F --> G["关联具体页码"]
    G --> H["生成修改建议"]
    H --> I["输出合同审阅报告"]

这已经不是一次简单的模型调用,而是一条完整的文档工作流。

2. Agent 可以调用的工具

文档工具

  • 打开文档
  • 获取页面
  • 提取文本
  • 获取文档结构
  • 读取元数据
  • 查找章节
  • 获取选中区域

OCR 工具

  • 对页面执行 OCR
  • 对文档执行 OCR
  • 获取 OCR 结果
  • 检查识别置信度
  • 重新识别指定区域

检索工具

  • 关键词搜索
  • 全文检索
  • 语义检索
  • 多文档检索
  • 元数据过滤
  • 结果重排序

分析工具

  • 摘要
  • 分类
  • 实体提取
  • 表格理解
  • 条款分析
  • 风险分析
  • 文档比较

编辑工具

  • 删除页面
  • 重排页面
  • 拆分文档
  • 合并文档
  • 添加批注
  • 添加高亮
  • 遮盖敏感信息
  • 导出新 PDF

导出工具

  • 导出 Markdown
  • 导出 Word
  • 导出 JSON
  • 导出纯文本
  • 导出分析报告
  • 导出结构化数据

3. Agent 的执行安全

文档编辑和文件操作具有实际影响,因此 PDF Agent 需要明确区分只读操作和修改操作。

可以直接执行的只读操作

  • 分析文档
  • 搜索内容
  • 生成摘要
  • 提取信息
  • 建立索引
  • 比较多个文件

需要用户确认的修改操作

  • 删除页面
  • 覆盖原文件
  • 执行批量脱敏
  • 修改文字
  • 添加或移除签名
  • 合并或拆分文件
  • 导出并替换现有文件

PrivyPDF 可以在 Agent 执行修改前展示计划:

计划执行以下操作:

1. 检测并标记 12 处个人信息
2. 对其中 9 处执行文本遮盖
3. 对 3 处扫描图像执行区域遮盖
4. 生成新的脱敏 PDF
5. 保留原始文件不变

用户确认后,Agent 才执行实际修改。

这可以避免模型误判直接影响原始文档。

十、本地优先与隐私保护

PDF 往往包含高度敏感的信息:

  • 商业合同
  • 公司内部报告
  • 财务数据
  • 个人身份证明
  • 医疗材料
  • 未公开论文
  • 客户资料
  • 法律文件

因此,PrivyPDF 采用本地优先的产品方向。

本地优先并不意味着所有场景都必须完全离线,而是意味着用户应当能够控制:

  • 文件是否离开设备
  • OCR 在本地还是云端执行
  • 使用本地模型还是远程模型
  • 向模型发送哪些页面和片段
  • 是否保存聊天和分析历史
  • 是否建立长期文档索引
  • 是否允许跨设备同步

在支持的设备上,PrivyPDF 可以使用本地推理引擎完成:

  • 文档摘要
  • 基础问答
  • 文本提取
  • Embedding 生成
  • 向量检索
  • OCR 后处理
  • 信息分类

对于能力要求更高的复杂任务,用户也可以通过 Provider 连接不同模型服务。

flowchart TD
    A["PrivyPDF"] --> B["Apple 系统能力"]
    A --> C["本地模型"]
    A --> D["LocalEngine"]
    A --> E["Ollama"]
    A --> F["LM Studio"]
    A --> G["OpenAI 兼容模型服务"]

用户可以根据隐私、速度、模型质量和成本选择合适的处理方式。

十一、iOS 与 macOS 的协同

PrivyPDF 在 iOS 和 macOS 上承担不同角色。

iOS 更适合

  • 扫描现实世界中的文件
  • 快速导入附件
  • 移动阅读
  • 快速摘要
  • 即时问答
  • 信息提取
  • 在会议和通勤中使用

macOS 更适合

  • 处理长文档
  • 批量 OCR
  • 建立本地知识库
  • 多文档 RAG
  • 深度分析
  • PDF 编辑
  • Agent 自动化
  • 长期文档管理

一个典型的跨设备场景可能是:

  1. 用户使用 iPhone 扫描纸质合同。
  2. PrivyPDF 在 iOS 上完成页面校正和初步 OCR。
  3. 用户快速查看摘要并确认文件内容。
  4. 文档通过用户控制的同步方式进入 Mac。
  5. macOS 版本执行高质量 OCR、RAG 索引和条款分析。
  6. PDF Agent 生成风险报告和修改建议。
  7. 用户在 Mac 上完成批注和编辑。
  8. 最终版本可以重新在 iPhone 上查看和分享。

这样,移动端负责捕获和快速理解,桌面端负责深度处理和知识管理。

十二、典型使用场景

1. 论文阅读

用户导入一篇论文后,可以让 PrivyPDF:

  • 识别标题、作者和机构
  • 提取摘要和关键词
  • 解释研究问题
  • 总结方法和实验
  • 提取核心结论
  • 分析局限性
  • 解释公式和术语
  • 整理参考文献
  • 生成 Markdown 阅读笔记

进一步导入多篇论文后,还可以对比不同方法和实验结果。

2. 合同分析

对于合同类文档,PrivyPDF 可以:

  • 执行 OCR
  • 识别合同章节
  • 提取合同主体
  • 提取生效日期和期限
  • 分析付款条款
  • 分析终止条款
  • 分析责任限制
  • 分析自动续约
  • 标记潜在风险
  • 关联具体页码
  • 生成审阅报告

PrivyPDF 可以辅助用户理解合同,但不应替代专业法律意见。

3. 财务报告分析

用户可以导入企业财报或行业报告,并要求:

  • 提取收入、利润和现金流数据
  • 总结管理层观点
  • 分析主要风险
  • 查找不同季度的变化
  • 比较多份报告
  • 提取表格
  • 生成趋势摘要
  • 查找具体指标来源

4. 扫描资料数字化

对于书籍章节、纸质讲义或历史资料,PrivyPDF 可以:

  • 连续扫描多页
  • 自动校正页面
  • 执行 OCR
  • 恢复段落结构
  • 建立全文索引
  • 生成摘要
  • 转换为 Markdown
  • 建立可搜索知识库

5. 产品说明书与技术文档

用户可以将设备说明书、API 文档或运维手册导入 PrivyPDF,然后询问:

  • 设备如何初始化?
  • 某个错误码是什么意思?
  • 有哪些安全注意事项?
  • 某个功能在哪一页?
  • 安装步骤是什么?
  • 哪些型号支持该功能?

Agent 还可以将长篇说明书转换为操作清单。

6. 企业内部知识库

PrivyPDF 可以在本地管理一组内部文档:

  • 产品规范
  • 技术设计
  • 流程文档
  • 安全政策
  • 培训材料
  • 项目报告
  • 故障复盘

员工可以在不上传全部内部资料到公共云端知识库的情况下,对文档进行检索和问答。

十三、产品架构

flowchart TD
    A["PrivyPDF UI<br/>iOS Scanner / macOS Workspace"] --> B["PDF Agent Runtime<br/>Intent / Planning / Tools / Policy"]
    B --> C["Document Intelligence<br/>Parse / OCR / Layout / Extraction"]
    C --> D["RAG Engine<br/>Chunk / Embed / Search / Rerank"]
    D --> E["PDF Editing<br/>Pages / Annotation / Redaction"]
    E --> F["Model Provider Layer<br/>LocalEngine / Ollama / LM Studio / OpenAI-compatible Providers"]
    F --> G["Local Data Layer<br/>SQLite / FTS / Vector / File Store"]

PDF UI 层

负责:

  • 文档列表
  • PDF 阅读
  • 页面缩略图
  • 扫描
  • 导入
  • 搜索
  • 聊天
  • 批注
  • Agent 任务展示

Document Intelligence 层

负责:

  • PDF 解析
  • 页面结构
  • OCR
  • 版面识别
  • 表格和图片提取
  • 文档结构重建

RAG Engine

负责:

  • 文本清理
  • 文档分块
  • Embedding
  • 全文索引
  • 向量索引
  • 混合检索
  • 结果重排序
  • 引用定位

Agent Runtime

负责:

  • 理解用户意图
  • 生成处理计划
  • 选择工具
  • 调用工具
  • 权限检查
  • 用户审批
  • 执行结果验证
  • 最终回答生成

Provider Layer

负责统一不同模型来源:

  • 端侧模型
  • LocalEngine
  • Ollama
  • LM Studio
  • 自托管模型
  • OpenAI 兼容 API

十四、PrivyPDF 与传统 PDF 工具的区别

能力传统 PDF 阅读器AI PDF 聊天工具PrivyPDF
PDF 阅读支持支持支持
页面编辑通常支持通常较弱支持并与 Agent 结合
扫描部分支持通常不支持iOS 核心入口
OCR部分支持依赖上传平台本地优先、完整工作流
文档摘要不支持或较弱支持支持多种摘要模式
文档问答不支持支持支持并关联页面来源
本地 RAG通常不支持通常云端处理本地优先
多文档分析较弱部分支持作为核心能力规划
PDF 修改支持手动修改通常不支持支持 Agent 规划和执行
本地模型不支持较少支持多 Provider 架构
自动化任务不支持通常只回答问题PDF Agent
隐私控制文件本地,但无 AI依赖服务商文件、索引和模型可本地运行

PrivyPDF 的差异不在于某一个单独功能,而在于把文档理解、RAG、编辑和 Agent 整合为统一系统。

十五、PrivyPDF 的产品原则

1. Local First

用户文档默认属于用户本人。

PDF 文件、OCR 结果、向量索引和分析历史应优先保存在本地,用户可以明确控制是否调用远程服务。

2. Source Grounded

所有重要回答都应尽可能关联原始文档来源,包括:

  • 文件名
  • 页码
  • 章节
  • 原文片段
  • 页面位置

AI 不应该只给出看似合理但无法核对的回答。

3. Agent with Approval

Agent 可以规划和执行任务,但涉及文件修改、覆盖或批量操作时,应让用户保持控制权。

4. Document Native

PrivyPDF 不是通用聊天应用加一个 PDF 上传按钮。

产品应围绕 PDF 的页面、结构、坐标、批注、OCR、索引和编辑构建。

5. Cross-device

iPhone 负责捕获和即时理解,Mac 负责深度处理、知识管理和 Agent 工作流。

十六、未来演进方向

更强的版面理解

  • 多栏阅读顺序恢复
  • 表格结构识别
  • 数学公式识别
  • 图表理解
  • 页眉页脚过滤
  • 脚注和引用关联

更强的 OCR

  • 多语言 OCR
  • 手写文字识别
  • OCR 区域修正
  • OCR 结果编辑
  • 批量 OCR 队列
  • OCR 质量评估

更强的知识库

  • 文件夹级知识空间
  • 标签和集合
  • 多文档关系
  • 引用图谱
  • 文档版本比较
  • 长期记忆
  • 文档自动分类

更强的 Agent

  • 合同审阅 Agent
  • 论文阅读 Agent
  • 财务报告 Agent
  • OCR 修复 Agent
  • 文档脱敏 Agent
  • PDF 整理 Agent
  • 表格提取 Agent
  • 知识库构建 Agent

更强的编辑和自动化

  • 自然语言编辑 PDF
  • 自动添加书签
  • 自动生成目录
  • 自动拆分章节
  • 自动脱敏
  • 自动分类归档
  • 自动生成新文档
  • 批量文档工作流

十七、从 PDF 工具到文档智能入口

PDF 已经不仅仅是一种文件格式。

它是个人和企业知识的重要载体,承载着大量需要被理解、检索、验证和处理的信息。

PrivyPDF 希望完成三个层次的升级。

第一层,是让 PDF 更容易被数字化:

扫描、导入、OCR 和结构化。

第二层,是让 PDF 更容易被理解:

摘要、问答、提取、检索和多文档分析。

第三层,是让 PDF 可以参与实际工作:

编辑、转换、自动化和 Agent 执行。

最终,PrivyPDF 不再只是一个“打开 PDF 的应用”,而是一个连接现实文档、本地知识和 AI Agent 的工作平台。

在 iPhone 上,用户可以扫描一张纸,并立即理解其中的信息。

在 Mac 上,用户可以把大量 PDF 构建成本地知识库,并通过自然语言完成检索、分析和编辑。

这就是 PrivyPDF 的长期方向:

一个运行在 Apple 设备上的、本地优先的 PDF Agent。

了解 PrivyPDF 产品