办公智能体的 Skill 列表很容易越装越长,但“功能看起来齐全”并不等于能交付。网页抓取可能卡在登录权限,文档生成可能只有预览而没有可编辑文件,消息连接器还可能具备超出任务需要的写入能力。选择 Skill 时,真正要回答的是:它能否在明确权限内接收现有输入,稳定地产生可复核的输出,并在失败时不造成外部影响。本文给出一套从任务定义、权限检查到小样本验收的流程,适合评估网页、文档、表格、消息和记忆类能力。
先把任务写成可验收合同
不要从“要装哪个 Skill”开始,而要先写清任务的输入、动作和输出。例如“整理行业资料”过于宽泛,可以改成:
这个合同能区分工具职责与模型职责。Skill 负责访问文件、网页或应用并产生结构化结果;模型负责分类、摘要和判断。两部分分别验收,出现错误时才知道应检查权限、解析器还是提示词。
用五个维度筛选候选 Skill
1. 输入是否匹配
确认 Skill 能处理现有文件格式、页面类型或应用对象。对 PDF、DOCX、XLSX 等文件,还要区分读取、修改和导出能力。只支持文本提取的工具,不能因为能生成摘要就被当作完整的文档编辑工具。
2. 输出是否可交付
输出不仅要“看起来正确”,还应满足后续流程要求:
- 表格是否保留字段类型与工作表结构;
- 演示文稿中的文字和图表是否可编辑;
- 摘要是否保留来源位置,便于回查;
- 写回操作是否产生独立副本,避免覆盖原件。
3. 权限是否最小化
阅读安装说明和代码,列出它会读取的目录、环境变量、网络地址以及可执行的系统命令。一个只做本地文件格式转换的 Skill,通常没有理由请求消息发送或大范围目录写入权限。权限超出任务范围时,应先缩小授权或放弃安装。
4. 依赖是否可审计
检查安装脚本、依赖来源和更新方式。未知下载地址、混淆脚本、运行时动态执行代码,都需要进一步人工审查。模型可以辅助解释代码,但不能替代依赖锁定、系统权限和隔离环境。
5. 失败是否可恢复
区分只读动作与有外部影响的动作。读取网页、解析副本通常容易回滚;发送消息、提交审批、覆盖文件和修改日程则必须增加人工确认。测试时优先使用副本、测试账号和无敏感数据的小样本。
按风险安排安装与验收顺序
可以先测试只读、结果容易核对的能力,再测试写入型能力:
| 类别 | 首次测试任务 | 主要检查点 |
|---|---|---|
| 网页读取 | 提取一个公开页面的固定字段 | 来源、字段缺失、访问边界 |
| PDF/DOCX | 从副本提取标题与段落 | 顺序、乱码、原文件是否被改动 |
| XLSX | 汇总一张无公式测试表 | 数据类型、空值、公式和工作表 |
| 文件生成 | 生成一份最小可编辑文档 | 格式、可编辑性、再次打开是否正常 |
| 消息与日程 | 只读取测试账号中的一条记录 | 授权范围、是否存在隐式写入 |
| 长期记忆 | 保存一条非敏感格式偏好 | 可查看、可修改、可删除 |
每轮只改变一个变量。若同时更换 Skill、模型和提示词,即使结果改善,也无法确定变化来自哪里。
给每类任务设置人工复核点
结构化提取可以通过字段计数、抽样比对和模式校验复核。摘要与分类需要回到原文检查是否遗漏限定条件。合同、财务、人事等高风险内容即使格式正确,也不能直接视为业务结论。
外部写入操作应采用“生成草稿、显示差异、人工确认、执行写入”的顺序。提示词中的“不要发送”只是行为约束,真正的边界仍应由账号权限、应用授权和运行环境实现。
记录一次可复用的验收结果
完成小样本测试后,记录以下信息:
这份记录比“推荐安装”更有价值。版本、依赖或权限发生变化时,可以用相同样本重新验收,而不是沿用旧结论。
结论与限制
办公自动化 Skill 的选择标准不是数量,而是任务匹配、最小权限、可复核输出和失败可恢复。先写可验收合同,再用低风险样本逐项检查,可以把功能展示转化为明确的工程判断。
本文流程适合安装前筛选与团队内部验收,不能替代源代码审计、供应商条款审查或组织的安全评估。涉及敏感数据和外部写入时,还需要结合实际权限模型与合规要求单独验证。




