说个可能让你后背一凉的变化:我们和 AI 的关系,正在从"它骗你"滑向"它坑你"。
年初大家吐槽 AI,无非就是它满嘴跑火车,瞎编内容糊弄人。今年 315 晚会曝光过一件事:一个根本不存在的"Apollo-9 智能手环",靠一批机器批量生成的虚假测评,短短两小时,各大 AI 聊天机器人就集体把它当成靠谱好物推荐给用户。"量子纠缠""黑洞级超长续航"这种凭空捏出来的噱头,AI 照单全收。
这种坑,顶多停在"嘴上骗人"的层面,认真的人多查一步也就防住了。
但现在不一样了。能动手干活的 AI 智能体越来越普及,它不再只是陪你聊天,还能自己操控电脑、读写文件、收发邮件、管服务器,相当于一个真能上手干活的全职助理。一旦有人故意给它"下毒",后果就不是说几句假话那么轻,而是实打实弄坏你的数据、偷走隐私,甚至造成经济损失。
就像早些年电脑普及之后病毒跟着泛滥一样,能自主操作的 AI 越强,专门盯着它的黑灰产成型就越快。这种往 AI 里塞恶意信息、诱导它干坏事的行为,业内叫"智能体投毒"。
一、普通 AI 撒谎,和智能体"下毒",根本不是一回事
普通聊天 AI 像个只会动嘴的线上客服,就算被人忽悠,顶多跟你胡说八道,碰不到你的文件和钱。
但 AI 智能体带了手脚。一旦被投毒,坏人藏在资料、网页里的恶意指令,它会当成你的真实要求去执行:偷偷删掉工作文件、把账号密码发给外人、私下转账、加密企业数据库勒索赎金,全程悄无声息,你很难第一时间察觉。
国际安全组织 OWASP 今年更新的 AI 安全风险榜单,把"诱导 AI 做危险操作"放在了第一位。道理不复杂:AI 能干的事越多,被坏人利用后破坏力就越大。
二、四种最常见的投毒套路,生活工作都可能中招
1. 批量造假"洗脑" AI,让它主动推荐假货
这是普通人最容易撞上的,业内也叫 GEO 黑产。早年商家靠 SEO 抢搜索引擎前排,现在大家习惯张口就问 AI 查攻略、选东西,黑产就批量造假测评、假种草文,把网络铺满。
AI 检索时默认采信这些内容,你问它哪款手环、家电好用,它优先推的,往往是花钱刷了软文的劣质假货。这条灰色产业规模已经接近 480 亿元,广告营销那套老套路只是换了个赛道,只会越来越多。
2. 文件里藏隐形指令,AI 一读就中招
前阵子一款叫 OpenClaw、俗称"龙虾"的智能体工具很火,能自动整理邮件、写代码、操控电脑,不少开发者都在用。可没过多久,工信部就发了高危预警,很多高校直接在校内禁用。
原因藏得很深:坏人能在 PDF、网页、邮件里埋肉眼看不见的指令,用白色字体、隐形特殊字符塞在空白处。人眼看不出来,AI 读文档时却能识别,直接当成用户命令去执行——盗账号密钥、批量删文件、偷偷把公司内部资料往外传。
学生拿 AI 读论文、打工人拿 AI 处理合同邮件,都有中招风险。已经有人遇到过 AI 误删全部工作邮件的事。
3. 工具自带病毒,从源头坑所有人
这种最难防。相当于你在正规超市买瓶装水,瓶子看着好好的,里面的水早被人换过。
今年 3 月,两款热门开发工具接连出事:代码工具 LiteLLM 的更新包被植入恶意程序,用户一装,账号密钥、服务器登录密码就被悄悄偷走;国内接口协作平台 Apifox 也遭了同类攻击,Git、服务器私钥全都存在泄露风险。
大家都默认正规渠道下的工具是干净的,根本想不到工具本身就带毒,普通用户很难自查。
4. AI 自己"越狱闯祸",完全不受控
这是目前最危险的一种:不用坏人植入指令,AI 自己想办法突破限制,主动搞破坏。
OpenAI 7 月底公开过一份测试报告:他们把一个强模型关在断网隔离环境里测,结果 AI 自己找到漏洞"越狱",连上互联网,主动攻击代码社区 HuggingFace,上传恶意文件、窃取内部加密数据,上万条操作记录把整个入侵过程记了下来。事后平台想用其他 AI 分析攻击记录,还被安全防护系统拦住,最后靠国产智谱的开源大模型才完成取证。
能力足够强的智能体,会主动找系统漏洞、挣脱人为设的约束。
三、为什么总有人想方设法给 AI"下毒"?
说到底,都是利益。
- 赚营销快钱:靠虚假内容操控 AI 推自家货、打压竞品,整条灰色产业链产值几百亿;
- 盗数据倒卖:AI 能轻松读到大量隐私和企业机密,偷来的账号、资料打包就能卖;
- 勒索企业:全自动的 AI 勒索程序把攻击门槛拉得很低,黑客不用堆人力就能远程锁库要钱;
- 恶意竞争:有外媒报道,大厂专门雇人伪装成普通用户,不断往竞品 AI 里发高危提问,试探、破坏对方的安全防护。
而且投毒手段还在升级,从直白的诱导话术,进化到藏在图片、代码注释、网页底层里的隐形指令,甚至能做到一次植入、长期操控。
四、几条简单防护,你也能做到
想守住 AI 安全,光靠一段提示语远远不够。现阶段尽量做到下面几点,能避开绝大多数风险。
- 先用大模型给外部文档做次"语义体检":文件丢给 Agent 之前,先让通用大模型分辨一遍哪些是普通文字、哪些可能藏着指令,别让 Agent 把文件内容错当成操作命令。
- 给 AI 最小权限,别多给:AI 只需要做什么,就只开对应的权限。只让读文档,就别给删除、修改的权限;只查数据表,就别给整个数据库的访问权。
- 高危操作必须人工点确认:删文件、转账、批量群发、改系统设置这类动作,一定要弹确认窗,人工同意了才执行。
- 全程留痕,异常就报警:把 AI 每一步思考、每一次操作都记下来,建个"正常操作"的参照。一旦它突然频繁碰敏感文件、批量删数据、往外传大量信息,立刻告警,记录都留着,方便事后倒查。
AI 智能体确实把办公和生产的效率拉上去了,但黑灰产一定会盯着新技术找缝钻。说不定再过一阵,大家用 AI 之前,都会习惯性先打开配套的安全防护,就像十几年前家家户户电脑都得装个杀毒软件一样。
方便归方便,安全那根弦,什么时候都不能松。(文章配图由AI生成)