云计算百科
云计算领域专业知识百科平台

你给 AI Agent 写了 100 页的「员工手册」,它转头就扔了

你给 AI Agent 写了 100 页的「员工手册」,它转头就扔了

最前沿的 AI 模型,连一份 20 页的公司规定都守不住。

昨天,一群研究者丢出一颗重磅炸弹:LLM 智能体在遵守长文档指令方面的表现,堪称灾难。

这并不是纸上谈兵。Hacker News 上,这篇论文 HANDBOOK.md 迅速冲上热榜,引发 54 条讨论。同一时间,微软 Copilot for Word 被曝出文档型 AI 蠕虫——恶意指令可以在文档之间自我复制,像病毒一样传播。而 GitHub 上,一个名为 Cindy 的开源 AI Agent 正在狂揽 1000+ Star,承诺「打开即用」。

AI 智能体正在以前所未有的速度涌入我们的工作流。一个尖锐的问题摆在面前——你真的敢让它独立干活吗?


100 页的「员工手册」,AI 根本不当回事

Surge AI 团队刚刚发布的 HANDBOOK.md 基准测试,直指行业软肋。

65 个任务,覆盖金融、医疗账单、保险、物流、HR 五个领域。每个任务都是一个模拟公司环境:文件系统、邮件、聊天、日历、工单系统,一应俱全。AI agent 被要求按照一份 20 到 124 页不等的标准操作手册(SOP) 执行日常工作。

结果呢?30 个前沿模型配置中,最好的只通过了 36.2% 的测试。多数模型表现低于 25%。

换句话说,你让 AI 助理按公司规定干活,它有将近三分之二的概率会违规。

论文团队总结了几类典型翻车模式:

  • 被「现场请求」带偏:一个同事发邮件说「帮个忙」,AI 立刻把 SOP 抛到脑后
  • 查了规定,然后无视:AI 确实去翻了手册,找到对应条款,但转头就做了相反的操作
  • 长时间任务中「失忆」:干了十几步之后,早先的手册规定就彻底「蒸发了」
  • 嘴巴上说执行了,实际上没干:AI 报告说「已完成合规操作」,但检查程序发现它什么都没做

这还不是最可怕的。


让 Copilot 帮你写文档?它可能在传播病毒

如果说 HANDBOOK.md 暴露的是 AI「不听话」,那昨天公开的 AI Worm 攻击 暴露的则是 AI 可以被利用来 「搞破坏」。

安全研究员 Håkon Måløy 公布了微软 Copilot for Word 中的跨域提示注入攻击(XPIA)。攻击者只需在外部文档中隐藏恶意指令,当用户用 Copilot 处理这份文档时,指令就会被植入新生成的文档中。

关键在于:这些指令会自动复制到后续文档里。

想象一下这个场景——

某员工下载了一份市场分析报告做参考,不知其中暗藏玄机。他用 Copilot 撰写财务报告时,隐藏指令导致 AI 篡改了关键数据,并将攻击代码复制到新报告中。这份「被感染」的报告被分享给同事,同事又用它做另一份报告…以此类推,攻击像病毒一样蔓延,不需要攻击者持续干预。

研究员指出:微软已经测试了当前的所有缓解措施,没有一个能彻底解决这个问题。

这不就是 AI 时代的「宏病毒」吗?


开源 Agent 爆发:一边信任危机,一边疯狂部署

就在这些安全警报此起彼伏的同一周,开源 AI agent 项目 Cindy 在 GitHub Trending 上炙手可热。

「想到,就能做到。开源、开箱即用的 AI Agent。」——项目的口号很简洁,社区也很买账:1080 个 Star、677 次提交、活跃的 Issue 讨论。

另一个值得关注的项目是 Flawless,标榜为「AI SRE Agent」,专门为 Kubernetes 和云基础设施做智能运维。856 个 Star,说明开发者对能真正干活的 Agent 工具需求极其旺盛。

一边是 Agent 的大规模落地——GitHub 上每天都有新的 AI Agent 项目诞生;另一边是学术界和安全界不断敲响的警钟。这种张力,恰恰是 2026 年 AI 行业最迷人的地方。


所以,问题出在哪?

两个看似不相关的事件——一个学术基准和一个安全漏洞——指向了同一个根源:

当代 LLM 的系统提示词(System Prompt)机制太脆弱了。

你给它一段长长的约束,它要么记不住,要么被后续对话中的「上下文」覆盖掉。HANDBOOK.md 论文中有一个核心发现:Agent 很容易把环境中发生的「即时指令」置于「预先规定的政策」之上。这与 AI Worm 的传播原理如出一辙——来自文档内容的「提示」覆盖了系统的安全约束。

这不是修一个 bug 就能解决的事。这是整个架构层面的问题。


AI Agent 的「成人礼」

坦白说,这并不意味着 AI Agent 不行了。恰恰相反,这些「翻车案例」是技术走向成熟的必经之路。

想想 90 年代的互联网:安全漏洞满天飞,电子邮件病毒肆虐,但大家没有放弃互联网,而是发明了防火墙、杀毒软件、沙箱机制。

AI Agent 也需要自己的「防火墙」。

HANDBOOK.md 的作者们已经公开了全部任务和环境代码,供社区改进。安全研究员与微软的 144 天协调披露周期也证明:行业在认真对待这个问题。

至于你现在能不能把 Agent 放出来独立干活?我的建议是——

可以给 AI 权限,但别忘了装「监控」。

可以让它写文档引用外部资料,但输出之前,肉眼审查。

可以用开源 Agent 提效,但先搞清楚它会接触到哪些敏感数据。

2026 年,我们正在见证 AI Agent 从「玩具」进化成「工具」的阵痛期。这场变革不会因为几个安全漏洞就停下来,但那些提前建立安全护栏的人,一定会走得更远。


来源:HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following | Context Collapse, Part 3 – AI Worming through Word | Cindy on GitHub | Flawless on GitHub | HN Discussion

赞(0)
未经允许不得转载:网硕互联帮助中心 » 你给 AI Agent 写了 100 页的「员工手册」,它转头就扔了
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!