PrivyPDF:从 PDF 阅读工具到本地优先的 PDF Agent
PDF 是工作、学习和研究中最常见的文档格式之一。
合同、论文、财务报告、产品文档、扫描件、会议材料、说明书和电子书,最终往往都会以 PDF 的形式保存。但传统 PDF 工具主要解决的是“打开、阅读和编辑”,用户仍然需要自己完成信息定位、内容理解、知识整理和后续处理。
PrivyPDF 希望重新定义 PDF 的使用方式。它面向 iOS 与 macOS;可从 PrivyPDF 产品官网 了解产品。
它不只是一个 PDF 阅读器,也不只是一个 OCR 或文档问答工具,而是一套面向 iOS 和 macOS 的本地优先 PDF 智能工作平台。PrivyPDF 将 PDF 扫描、导入、OCR、结构化、检索、理解、编辑和 Agent 自动化整合到一个统一流程中,让 PDF 从静态文件转变为可以被理解、检索和操作的知识载体。
PrivyPDF 的核心目标可以概括为:
让用户不仅能够阅读 PDF,还能够让 AI 理解 PDF、分析 PDF,并围绕 PDF 完成实际任务。
一、为什么需要一个 PDF Agent
传统 PDF 应用通常集中在以下能力:
- 打开和阅读 PDF
- 搜索关键词
- 添加批注和高亮
- 合并或拆分文件
- 填写表单
- 修改页面或文本
- 将扫描件转换为可搜索文档
这些功能依然重要,但它们解决的主要是“文件操作”问题,而不是“内容处理”问题。
面对一份几十页甚至几百页的文档,用户真正关心的通常是:
- 这份文档主要讲了什么?
- 哪些内容与我当前的问题有关?
- 某个结论出现在什么位置?
- 文档中有哪些重要数字、人物、日期和条款?
- 多份 PDF 之间有什么联系或冲突?
- 扫描件中的文字能否被准确识别?
- 能否自动整理为摘要、笔记或结构化数据?
- 能否基于文档内容继续执行下一步任务?
传统 PDF 阅读器要求用户主动搜索、翻页和整理,而 PDF Agent 则可以主动理解用户目标,规划处理步骤,并调用 OCR、检索、模型推理和 PDF 编辑能力完成任务。
因此,PrivyPDF 的产品定位不是“给 PDF 增加一个聊天窗口”,而是围绕 PDF 构建一个完整的智能处理系统。
二、PrivyPDF 的整体产品定位
PrivyPDF 面向两个主要使用环境。
iOS:随时捕获、扫描和理解文档
在移动端,PDF 往往来自现实世界和即时场景:
- 使用摄像头扫描纸质文件
- 从邮件或聊天应用导入附件
- 从 Safari 下载报告
- 从“文件”应用选择 PDF
- 扫描票据、合同、说明书或课堂材料
- 在通勤或会议中快速理解文档
因此,iOS 版本的核心不是复杂编辑,而是:
快速把现实世界中的文档变成可理解、可搜索、可提问的数字内容。
完整流程包括:
flowchart TD
A["拍摄或导入"] --> B["图像校正与页面处理"]
B --> C["OCR 文字识别"]
C --> D["文档结构分析"]
D --> E["内容摘要与理解"]
E --> F["问答、提取与导出"]
macOS:构建完整的 PDF 知识工作流
在桌面端,用户通常需要处理更复杂、更长时间跨度的任务:
- 阅读长篇论文和报告
- 分析合同或技术文档
- 管理大量本地 PDF
- 对扫描件进行批量 OCR
- 建立文档知识库
- 基于多份 PDF 进行检索和问答
- 修改、重组或导出文档
- 让 Agent 执行多步骤文档任务
因此,macOS 版本的核心是:
将 PDF 转化为本地知识库,并通过 Agent 完成检索、分析、编辑和知识生产。
完整流程包括:
flowchart TD
A["PDF 导入"] --> B["文档解析"]
B --> C["OCR 与版面识别"]
C --> D["文本分块与向量化"]
D --> E["建立本地 RAG 索引"]
E --> F["内容理解与跨文档检索"]
F --> G["PDF 编辑与结果导出"]
G --> H["Agent 自动执行任务"]
iOS 和 macOS 并不是两个独立产品,而是同一个 PDF Agent 在不同设备上的能力延伸。
三、PrivyPDF for iOS:从扫描到理解
1. 使用摄像头扫描纸质文档
很多重要内容仍然存在于纸张之中,例如:
- 纸质合同
- 学校资料
- 医疗或保险文件
- 产品说明书
- 会议白板
- 收据与账单
- 手写或打印笔记
PrivyPDF 可以通过 iPhone 摄像头完成文档扫描。
扫描过程不仅是拍照,还包括:
- 自动检测页面边缘
- 透视校正
- 页面裁剪
- 亮度和对比度优化
- 阴影与背景处理
- 多页连续扫描
- 页面方向识别
- 扫描结果预览和调整
处理后的页面可以直接生成 PDF,也可以继续进入 OCR 和文档理解流程。
用户不需要先使用扫描应用生成 PDF,再切换到其他 AI 工具分析。扫描、识别和理解可以在 PrivyPDF 内部连续完成。
2. 从系统和其他应用导入 PDF
除扫描外,PrivyPDF 还可以承接来自 iOS 系统中的各种 PDF 文件。
典型入口包括:
- 从“文件”应用导入
- 从 iCloud Drive 导入
- 从邮件附件打开
- 从 Safari 下载后打开
- 通过系统分享菜单发送到 PrivyPDF
- 从其他即时通信或办公应用导入
- 从相册导入文档图片
这种设计让 PrivyPDF 成为 iOS 上统一的 PDF 智能处理入口。
用户看到一份需要分析的文档时,可以直接选择“使用 PrivyPDF 打开”,而不必先移动文件或调整格式。
3. 移动端 OCR
很多 PDF 实际上并不包含可选中的文本。
例如扫描生成的 PDF,本质上只是一组图片。传统关键词搜索、复制和 AI 分析都无法直接处理这些内容。
PrivyPDF 可以对页面执行 OCR,将图像中的文字转换为可检索文本。
OCR 流程包括:
- 页面图像预处理
- 文字区域检测
- 文本识别
- 阅读顺序恢复
- 段落和页面结构重建
- OCR 结果与原始页面位置关联
完成 OCR 后,用户可以:
- 搜索扫描件中的文字
- 复制识别后的内容
- 对扫描文件进行总结
- 询问某个条款或段落
- 提取日期、金额和名称
- 将识别结果导出为 Markdown、Word 或结构化数据
PrivyPDF 的目标不是只输出一份纯文本,而是尽可能保留文字与原始页面之间的对应关系。
这样,当 AI 给出回答时,用户仍然可以回到原始页面核对内容。
4. PDF 摘要与快速理解
在移动设备上,用户通常没有足够时间逐页阅读长文档。
PrivyPDF 可以根据 PDF 内容生成不同层级的摘要:
- 一句话摘要
- 核心观点摘要
- 分章节摘要
- 关键结论列表
- 重要数字与日期
- 风险和注意事项
- 面向特定目标的定向摘要
例如,对于一份产品说明书,用户可以要求:
告诉我这份说明书中最重要的安装步骤和安全注意事项。
对于一份合同,可以要求:
总结付款、续约、终止和违约相关的条款。
对于一篇论文,可以要求:
解释研究问题、方法、实验结果和局限性。
PrivyPDF 不只是压缩文档长度,而是根据用户的真实目标重新组织文档信息。
5. 基于 PDF 的问答
用户可以直接围绕当前 PDF 提问,例如:
- 这份文档的主要结论是什么?
- 第三章解决了什么问题?
- 合同的终止条件是什么?
- 文件中提到了哪些时间节点?
- 作者使用了什么实验方法?
- 这份报告有哪些潜在风险?
- 哪些内容与数据隐私有关?
- 帮我解释这一页中的专业术语。
回答可以关联到具体页面或文本片段,使用户能够查看答案来源。
这与普通聊天模型的区别在于,PrivyPDF 的回答基于用户导入的真实文档,而不是仅依赖模型自身知识。
6. 信息提取
除了总结和问答,移动端还适合快速提取信息。
PrivyPDF 可以从文档中识别并整理:
- 姓名
- 公司名称
- 地址
- 日期
- 金额
- 账户信息
- 合同条款
- 产品型号
- 参考文献
- 表格内容
- 待办事项
- 联系方式
提取结果可以转换为结构化格式,方便用户复制、保存或发送到其他应用。
例如,从一份发票中提取:
{
"invoiceNumber": "INV-2026-0012",
"date": "2026-07-20",
"vendor": "Example Company",
"total": "SGD 1,280.00"
}
从会议材料中提取:
- 决策事项
- 负责人
- 截止日期
- 风险项
- 后续行动
这使 PrivyPDF 从阅读工具进一步转变为信息处理工具。
四、PrivyPDF for macOS:从 PDF 到本地知识库
1. 多种 PDF 导入方式
macOS 版本可以处理更加完整的桌面文件工作流。
用户可以通过以下方式导入文档:
- 拖拽 PDF 到应用
- 选择本地文件
- 导入整个文件夹
- 从 Finder 使用“打开方式”
- 通过系统分享菜单导入
- 批量导入多份 PDF
- 监听指定文档目录
导入后,PrivyPDF 会建立文档记录,并进入解析、OCR 和索引流程。
对于已经包含文本层的 PDF,可以直接提取内容;对于扫描 PDF,则自动或按需执行 OCR。
2. PDF 文档解析
PDF 是一种面向页面展示的格式,而不是天然适合语义理解的文档格式。
页面中的文本可能被拆分为大量独立字符或文本块,阅读顺序也不一定与视觉顺序一致。此外,PDF 还可能包含:
- 多栏排版
- 页眉和页脚
- 脚注
- 表格
- 图片
- 公式
- 注释
- 扫描页面
- 混合语言内容
PrivyPDF 在导入后需要先建立文档的内部表示,包括:
- 页面
- 文本块
- 段落
- 标题
- 章节
- 表格
- 图像
- 注释
- 页面坐标
- 文档元数据
这个内部结构是后续 OCR、RAG、问答和编辑能力的基础。
3. OCR 与扫描文档处理
macOS 版本支持更完整的 OCR 工作流。
用户可以对单页、指定页面或整份文档执行 OCR,也可以批量处理多个扫描 PDF。
OCR 后,PrivyPDF 可以生成:
- 可搜索文本层
- 页面级识别结果
- 段落级文本
- 文本坐标信息
- OCR 置信度
- 可复制内容
- 可供 RAG 使用的结构化文本
对于识别质量较低的区域,可以保留原始图像和识别结果,方便后续校正。
OCR 不应被视为一个孤立功能,它是扫描 PDF 进入 AI 工作流的入口。
完成 OCR 后,原本不可搜索的扫描文件就可以参与:
- 全文检索
- 语义检索
- 文档问答
- 信息提取
- 摘要生成
- 跨文档分析
五、PDF 的 RAG 化
1. 什么是 PDF RAG
RAG,即 Retrieval-Augmented Generation,可以理解为“先检索文档,再让模型基于检索结果回答”。
如果直接把一整份长 PDF 发送给模型,会面临多个问题:
- 文档可能超过模型上下文限制
- 每次提问都需要重新处理大量文本
- 推理速度慢
- 计算和 API 成本高
- 回答难以定位来源
- 多份文档难以统一管理
PrivyPDF 会将 PDF 转换为可以被检索的本地知识库。
处理流程通常包括:
flowchart TD
A["PDF"] --> B["文本与结构提取"]
B --> C["内容清理"]
C --> D["章节和语义分块"]
D --> E["Embedding 向量生成"]
E --> F["本地向量索引"]
F --> G["关键词与语义混合检索"]
G --> H["模型生成回答"]
这个过程可以称为 PDF 的“RAG 化”。
2. 文档分块
分块不是简单地按照固定字符数切割文本。
PrivyPDF 可以结合文档结构进行分块,例如:
- 按标题和章节分块
- 按段落分块
- 按页面分块
- 按表格分块
- 按语义边界分块
- 保留重叠上下文
- 保留页面和坐标引用
每个内容块都可以携带元数据:
文档 ID
文件名
页码
章节
标题
内容类型
创建时间
OCR 状态
页面坐标
这些元数据可以帮助系统生成更加准确和可追溯的回答。
3. 本地向量索引
PrivyPDF 可以在本地生成并保存文档向量索引。
这意味着用户不需要每次提问时重新上传整份文档,也不必依赖远程云端知识库。
本地索引的优势包括:
- 文档处理速度更快
- 支持离线使用
- 降低云端 API 成本
- 减少隐私泄露风险
- 支持长期管理大量文档
- 可以跨文档搜索
- 文档删除后可同步删除索引
对于隐私敏感的 PDF,例如合同、内部报告、个人材料和未公开研究文档,本地索引尤其重要。
4. 关键词与语义混合检索
纯关键词搜索要求用户准确知道文档中的原始表达。
例如,文档中使用的是“termination clause”,用户搜索“如何结束合同”,传统关键词搜索可能无法命中。
语义检索可以理解用户问题和文档表达之间的语义关系。
但纯语义检索也可能在精确数字、专有名词和代码等场景下表现不足。
因此,PrivyPDF 可以结合:
- 关键词检索
- 全文检索
- 向量语义检索
- 页面过滤
- 文档过滤
- 元数据过滤
- 结果重排序
形成混合检索系统。
六、从单文档问答到多文档理解
PrivyPDF 不只处理单个 PDF,还可以围绕多个文档建立知识空间。
例如,用户可以导入:
- 多篇同一研究方向的论文
- 一个项目的全部技术文档
- 多个版本的合同
- 一组财务报告
- 产品说明书和故障手册
- 不同供应商的方案文档
然后进行跨文档分析:
- 比较这些论文的方法和结论
- 找出两个合同版本之间的变化
- 总结不同报告中的共同风险
- 对比多个产品的技术参数
- 查找所有文档中关于某个主题的内容
- 分析同一指标在不同年份的变化
- 找出文档之间的冲突和不一致
这种能力让 PrivyPDF 从单文件工具转向本地文档知识库。
七、PDF 理解不只是聊天
许多 AI PDF 产品的交互方式是“上传 PDF,然后聊天”。
聊天是重要入口,但不是完整的产品形态。
PrivyPDF 希望把常见任务沉淀为明确能力。
文档摘要
- 全文摘要
- 章节摘要
- 面向管理者的执行摘要
- 面向研究人员的方法与结论摘要
- 面向普通用户的简化解释
内容分析
- 观点分析
- 风险分析
- 条款分析
- 数据分析
- 逻辑结构分析
- 论据与结论分析
- 文档完整性检查
信息提取
- 实体提取
- 表格提取
- 日期和金额提取
- 引用和参考文献提取
- 行动项提取
- 关键指标提取
文档转换
- PDF 转 Markdown
- PDF 转 Word
- PDF 转纯文本
- PDF 转 JSON
- PDF 转结构化笔记
- PDF 转问答卡片
- PDF 转知识库内容
文档生成
- 基于 PDF 生成报告
- 基于论文生成阅读笔记
- 基于合同生成审阅清单
- 基于说明书生成操作指南
- 基于多份文档生成对比报告
这些能力可以通过预设工作流使用,也可以由 PDF Agent 动态组合。
八、PDF 编辑能力
在 macOS 上,理解文档之后,用户往往还需要修改文档。
PrivyPDF 可以逐步整合常见 PDF 编辑能力:
- 页面删除
- 页面旋转
- 页面排序
- 页面拆分
- 多文档合并
- 页面提取
- 添加文本
- 添加批注
- 添加高亮
- 添加签名
- 添加图片
- 添加水印
- 文本遮盖
- 敏感信息脱敏
- 表单填写
- 元数据修改
更重要的是,编辑能力可以与 AI 理解结合。
例如用户可以提出:
- 删除所有空白页面。
- 把包含附件的页面提取为单独 PDF。
- 高亮所有涉及付款义务的条款。
- 找出个人信息并执行脱敏。
- 将文档按章节拆分。
- 为每一章添加书签。
- 把 OCR 识别错误较多的页面列出来。
- 提取所有图表并生成索引。
- 删除页眉和页脚后导出文本。
- 为文档生成目录并插入第一页。
传统 PDF 编辑器要求用户手动执行每一个操作,而 PDF Agent 可以先理解任务,再规划和执行操作。
九、PrivyPDF Agent
1. 什么是 PDF Agent
PDF Agent 是一个围绕文档目标执行多步骤任务的智能系统。
与普通问答不同,Agent 不只是生成一段文字,而是能够:
- 理解用户意图
- 检查当前文档状态
- 选择合适的工具
- 制定执行计划
- 调用 OCR、检索、分析或编辑能力
- 验证执行结果
- 向用户返回结果和来源
例如,用户输入:
分析这份合同,找出对我不利的条款,并生成一份修改建议。
PDF Agent 可以执行:
flowchart TD
A["识别文档类型"] --> B["检查是否需要 OCR"]
B --> C["提取合同结构"]
C --> D["识别付款、责任、终止和争议条款"]
D --> E["检索相关上下文"]
E --> F["分析潜在风险"]
F --> G["关联具体页码"]
G --> H["生成修改建议"]
H --> I["输出合同审阅报告"]
这已经不是一次简单的模型调用,而是一条完整的文档工作流。
2. Agent 可以调用的工具
文档工具
- 打开文档
- 获取页面
- 提取文本
- 获取文档结构
- 读取元数据
- 查找章节
- 获取选中区域
OCR 工具
- 对页面执行 OCR
- 对文档执行 OCR
- 获取 OCR 结果
- 检查识别置信度
- 重新识别指定区域
检索工具
- 关键词搜索
- 全文检索
- 语义检索
- 多文档检索
- 元数据过滤
- 结果重排序
分析工具
- 摘要
- 分类
- 实体提取
- 表格理解
- 条款分析
- 风险分析
- 文档比较
编辑工具
- 删除页面
- 重排页面
- 拆分文档
- 合并文档
- 添加批注
- 添加高亮
- 遮盖敏感信息
- 导出新 PDF
导出工具
- 导出 Markdown
- 导出 Word
- 导出 JSON
- 导出纯文本
- 导出分析报告
- 导出结构化数据
3. Agent 的执行安全
文档编辑和文件操作具有实际影响,因此 PDF Agent 需要明确区分只读操作和修改操作。
可以直接执行的只读操作
- 分析文档
- 搜索内容
- 生成摘要
- 提取信息
- 建立索引
- 比较多个文件
需要用户确认的修改操作
- 删除页面
- 覆盖原文件
- 执行批量脱敏
- 修改文字
- 添加或移除签名
- 合并或拆分文件
- 导出并替换现有文件
PrivyPDF 可以在 Agent 执行修改前展示计划:
计划执行以下操作:
1. 检测并标记 12 处个人信息
2. 对其中 9 处执行文本遮盖
3. 对 3 处扫描图像执行区域遮盖
4. 生成新的脱敏 PDF
5. 保留原始文件不变
用户确认后,Agent 才执行实际修改。
这可以避免模型误判直接影响原始文档。
十、本地优先与隐私保护
PDF 往往包含高度敏感的信息:
- 商业合同
- 公司内部报告
- 财务数据
- 个人身份证明
- 医疗材料
- 未公开论文
- 客户资料
- 法律文件
因此,PrivyPDF 采用本地优先的产品方向。
本地优先并不意味着所有场景都必须完全离线,而是意味着用户应当能够控制:
- 文件是否离开设备
- OCR 在本地还是云端执行
- 使用本地模型还是远程模型
- 向模型发送哪些页面和片段
- 是否保存聊天和分析历史
- 是否建立长期文档索引
- 是否允许跨设备同步
在支持的设备上,PrivyPDF 可以使用本地推理引擎完成:
- 文档摘要
- 基础问答
- 文本提取
- Embedding 生成
- 向量检索
- OCR 后处理
- 信息分类
对于能力要求更高的复杂任务,用户也可以通过 Provider 连接不同模型服务。
flowchart TD
A["PrivyPDF"] --> B["Apple 系统能力"]
A --> C["本地模型"]
A --> D["LocalEngine"]
A --> E["Ollama"]
A --> F["LM Studio"]
A --> G["OpenAI 兼容模型服务"]
用户可以根据隐私、速度、模型质量和成本选择合适的处理方式。
十一、iOS 与 macOS 的协同
PrivyPDF 在 iOS 和 macOS 上承担不同角色。
iOS 更适合
- 扫描现实世界中的文件
- 快速导入附件
- 移动阅读
- 快速摘要
- 即时问答
- 信息提取
- 在会议和通勤中使用
macOS 更适合
- 处理长文档
- 批量 OCR
- 建立本地知识库
- 多文档 RAG
- 深度分析
- PDF 编辑
- Agent 自动化
- 长期文档管理
一个典型的跨设备场景可能是:
- 用户使用 iPhone 扫描纸质合同。
- PrivyPDF 在 iOS 上完成页面校正和初步 OCR。
- 用户快速查看摘要并确认文件内容。
- 文档通过用户控制的同步方式进入 Mac。
- macOS 版本执行高质量 OCR、RAG 索引和条款分析。
- PDF Agent 生成风险报告和修改建议。
- 用户在 Mac 上完成批注和编辑。
- 最终版本可以重新在 iPhone 上查看和分享。
这样,移动端负责捕获和快速理解,桌面端负责深度处理和知识管理。
十二、典型使用场景
1. 论文阅读
用户导入一篇论文后,可以让 PrivyPDF:
- 识别标题、作者和机构
- 提取摘要和关键词
- 解释研究问题
- 总结方法和实验
- 提取核心结论
- 分析局限性
- 解释公式和术语
- 整理参考文献
- 生成 Markdown 阅读笔记
进一步导入多篇论文后,还可以对比不同方法和实验结果。
2. 合同分析
对于合同类文档,PrivyPDF 可以:
- 执行 OCR
- 识别合同章节
- 提取合同主体
- 提取生效日期和期限
- 分析付款条款
- 分析终止条款
- 分析责任限制
- 分析自动续约
- 标记潜在风险
- 关联具体页码
- 生成审阅报告
PrivyPDF 可以辅助用户理解合同,但不应替代专业法律意见。
3. 财务报告分析
用户可以导入企业财报或行业报告,并要求:
- 提取收入、利润和现金流数据
- 总结管理层观点
- 分析主要风险
- 查找不同季度的变化
- 比较多份报告
- 提取表格
- 生成趋势摘要
- 查找具体指标来源
4. 扫描资料数字化
对于书籍章节、纸质讲义或历史资料,PrivyPDF 可以:
- 连续扫描多页
- 自动校正页面
- 执行 OCR
- 恢复段落结构
- 建立全文索引
- 生成摘要
- 转换为 Markdown
- 建立可搜索知识库
5. 产品说明书与技术文档
用户可以将设备说明书、API 文档或运维手册导入 PrivyPDF,然后询问:
- 设备如何初始化?
- 某个错误码是什么意思?
- 有哪些安全注意事项?
- 某个功能在哪一页?
- 安装步骤是什么?
- 哪些型号支持该功能?
Agent 还可以将长篇说明书转换为操作清单。
6. 企业内部知识库
PrivyPDF 可以在本地管理一组内部文档:
- 产品规范
- 技术设计
- 流程文档
- 安全政策
- 培训材料
- 项目报告
- 故障复盘
员工可以在不上传全部内部资料到公共云端知识库的情况下,对文档进行检索和问答。
十三、产品架构
flowchart TD
A["PrivyPDF UI<br/>iOS Scanner / macOS Workspace"] --> B["PDF Agent Runtime<br/>Intent / Planning / Tools / Policy"]
B --> C["Document Intelligence<br/>Parse / OCR / Layout / Extraction"]
C --> D["RAG Engine<br/>Chunk / Embed / Search / Rerank"]
D --> E["PDF Editing<br/>Pages / Annotation / Redaction"]
E --> F["Model Provider Layer<br/>LocalEngine / Ollama / LM Studio / OpenAI-compatible Providers"]
F --> G["Local Data Layer<br/>SQLite / FTS / Vector / File Store"]
PDF UI 层
负责:
- 文档列表
- PDF 阅读
- 页面缩略图
- 扫描
- 导入
- 搜索
- 聊天
- 批注
- Agent 任务展示
Document Intelligence 层
负责:
- PDF 解析
- 页面结构
- OCR
- 版面识别
- 表格和图片提取
- 文档结构重建
RAG Engine
负责:
- 文本清理
- 文档分块
- Embedding
- 全文索引
- 向量索引
- 混合检索
- 结果重排序
- 引用定位
Agent Runtime
负责:
- 理解用户意图
- 生成处理计划
- 选择工具
- 调用工具
- 权限检查
- 用户审批
- 执行结果验证
- 最终回答生成
Provider Layer
负责统一不同模型来源:
- 端侧模型
- LocalEngine
- Ollama
- LM Studio
- 自托管模型
- OpenAI 兼容 API
十四、PrivyPDF 与传统 PDF 工具的区别
| 能力 | 传统 PDF 阅读器 | AI PDF 聊天工具 | PrivyPDF |
|---|---|---|---|
| PDF 阅读 | 支持 | 支持 | 支持 |
| 页面编辑 | 通常支持 | 通常较弱 | 支持并与 Agent 结合 |
| 扫描 | 部分支持 | 通常不支持 | iOS 核心入口 |
| OCR | 部分支持 | 依赖上传平台 | 本地优先、完整工作流 |
| 文档摘要 | 不支持或较弱 | 支持 | 支持多种摘要模式 |
| 文档问答 | 不支持 | 支持 | 支持并关联页面来源 |
| 本地 RAG | 通常不支持 | 通常云端处理 | 本地优先 |
| 多文档分析 | 较弱 | 部分支持 | 作为核心能力规划 |
| PDF 修改 | 支持手动修改 | 通常不支持 | 支持 Agent 规划和执行 |
| 本地模型 | 不支持 | 较少支持 | 多 Provider 架构 |
| 自动化任务 | 不支持 | 通常只回答问题 | PDF Agent |
| 隐私控制 | 文件本地,但无 AI | 依赖服务商 | 文件、索引和模型可本地运行 |
PrivyPDF 的差异不在于某一个单独功能,而在于把文档理解、RAG、编辑和 Agent 整合为统一系统。
十五、PrivyPDF 的产品原则
1. Local First
用户文档默认属于用户本人。
PDF 文件、OCR 结果、向量索引和分析历史应优先保存在本地,用户可以明确控制是否调用远程服务。
2. Source Grounded
所有重要回答都应尽可能关联原始文档来源,包括:
- 文件名
- 页码
- 章节
- 原文片段
- 页面位置
AI 不应该只给出看似合理但无法核对的回答。
3. Agent with Approval
Agent 可以规划和执行任务,但涉及文件修改、覆盖或批量操作时,应让用户保持控制权。
4. Document Native
PrivyPDF 不是通用聊天应用加一个 PDF 上传按钮。
产品应围绕 PDF 的页面、结构、坐标、批注、OCR、索引和编辑构建。
5. Cross-device
iPhone 负责捕获和即时理解,Mac 负责深度处理、知识管理和 Agent 工作流。
十六、未来演进方向
更强的版面理解
- 多栏阅读顺序恢复
- 表格结构识别
- 数学公式识别
- 图表理解
- 页眉页脚过滤
- 脚注和引用关联
更强的 OCR
- 多语言 OCR
- 手写文字识别
- OCR 区域修正
- OCR 结果编辑
- 批量 OCR 队列
- OCR 质量评估
更强的知识库
- 文件夹级知识空间
- 标签和集合
- 多文档关系
- 引用图谱
- 文档版本比较
- 长期记忆
- 文档自动分类
更强的 Agent
- 合同审阅 Agent
- 论文阅读 Agent
- 财务报告 Agent
- OCR 修复 Agent
- 文档脱敏 Agent
- PDF 整理 Agent
- 表格提取 Agent
- 知识库构建 Agent
更强的编辑和自动化
- 自然语言编辑 PDF
- 自动添加书签
- 自动生成目录
- 自动拆分章节
- 自动脱敏
- 自动分类归档
- 自动生成新文档
- 批量文档工作流
十七、从 PDF 工具到文档智能入口
PDF 已经不仅仅是一种文件格式。
它是个人和企业知识的重要载体,承载着大量需要被理解、检索、验证和处理的信息。
PrivyPDF 希望完成三个层次的升级。
第一层,是让 PDF 更容易被数字化:
扫描、导入、OCR 和结构化。
第二层,是让 PDF 更容易被理解:
摘要、问答、提取、检索和多文档分析。
第三层,是让 PDF 可以参与实际工作:
编辑、转换、自动化和 Agent 执行。
最终,PrivyPDF 不再只是一个“打开 PDF 的应用”,而是一个连接现实文档、本地知识和 AI Agent 的工作平台。
在 iPhone 上,用户可以扫描一张纸,并立即理解其中的信息。
在 Mac 上,用户可以把大量 PDF 构建成本地知识库,并通过自然语言完成检索、分析和编辑。
这就是 PrivyPDF 的长期方向:
一个运行在 Apple 设备上的、本地优先的 PDF Agent。
Loading discussion…