五大风险,一张表看懂
人工智能的飞速发展带来了五类前所未有的安全挑战,它们技术复杂、隐蔽性强,对个人隐私、商业安全乃至社会信任体系构成深远影响。这份速览只回答三件事:风险是什么、代价有多大、该怎么做。
| 风险类别 | 主要攻击面 | 典型场景 | 关键控制点 |
|---|---|---|---|
| 数据泄露 | 员工输入、第三方依赖 | 机密源码粘贴进外部 AI;开源库漏洞导致数据串号 | 使用规范 + 数据环境隔离 + 组件审计 |
| 身份欺诈 | 音视频身份核验链路 | Deepfake 冒充高管下达紧急转账指令 | 多重交叉验证:回拨、当面、多人复核 |
| 服务中断 | 带宽、算力、API 接口 | 僵尸网络流量泛洪;高频调用生成类接口 | 流量清洗 + 频率限制与鉴权 + 自动熔断 |
| 模型自身安全 | System Prompt、多模态输入 | 提示词攻击、越狱、图像隐写注入 | 输入净化 + 动态对齐 + 多模态审核 |
| 供应链攻击 | 开源库、插件、依赖包 | 维护者账号被劫持后发布恶意版本 | 组件审计 + 插件最小权限 + 签名校验 |
每类风险为什么难防
- 数据泄露 · 大模型的记忆特性让数据脱敏与保护异常艰难,泄露途径从内部误操作一直延伸到供应链环节。
- 身份欺诈 · 仅需少量声音片段或面部图像即可生成高度逼真的音视频,传统视频核验、语音确认手段彻底失效。
- 服务中断 · 算力越集中,打击越致命;AI 服务对云端 GPU 集群的高度依赖,使其成为网络攻击的天然目标。
- 模型自身安全 · 模型难以严格区分「指令」与「数据」,攻击者无需复杂代码,仅靠自然语言交互即可突破护栏。
- 供应链攻击 · 攻击者可劫持账号或发布仿冒包,从源头破坏模型完整性,实现隐蔽且难以察觉的攻击。
若只能做三件事:敏感数据不出边界、身份必须二次核验、高危操作不交给自动化。
12 个真实案例:代价清单
伪造成本持续下降,而核验习惯没有同步升级——这是 12 个案例共同的演进方向。
| 风险类别 | 案例 | 时间 | 量级 |
|---|---|---|---|
| 数据泄露 | 三星 ChatGPT 数据泄露 | 2023.04 | 未公开源码 / 晶圆良率数据外泄 |
| 身份欺诈 | 香港深伪 CFO 诈骗 | 2024.02 | 2 亿港元 |
| 国内最大 AI 换脸诈骗案 | 2023.05 | 超 2 亿元 | |
| 福州 AI 换脸诈骗 | 2023.05 | 430 万元 / 10 分钟 | |
| FBI 揭露 AI 诈骗损失 | 2025 年度 | 22,364 起 / 8.93 亿美元 | |
| 网信办通报换脸 App 下架 | 2025.09 | 依法下架 + 公开点名 | |
| 服务中断 | DeepSeek 遭 DDoS 攻击 | 2025.01 | 服务大面积降级,被迫限制注册 |
| 模型自身安全 | EchoLeak 零点击漏洞 | 2025.06 | CVSS 9.3 Critical / 0 次交互 |
| ChatGPT 因开源库漏洞下线 | 2023.03 | 约 1.2% Plus 用户受影响 | |
| ChatGPT 提示注入新途径 | 2025.04 | 3 条轻量级攻击路径 | |
| CNCERT 实网众测 | 2025.09 | 281 个有效漏洞,63% 为模型特有 | |
| 供应链攻击 | litellm 供应链投毒 | 2026.03 | 云密钥 / SSH 私钥外泄 |
最该记住的四条
-
最薄弱的环节始终是人
三星员工为提升效率,把未公开源代码、内部会议纪要、晶圆制造良率数据直接粘进 ChatGPT。因服务条款默认允许用用户输入训练模型,核心资产就此面临被留存、分析与优化的风险。
-
音视频已不能作为身份凭证
中国香港某跨国企业财务人员被实时换脸的「CFO」与多名「同事」引入视频会议,绕过常规审批转出 2 亿港元,是全球首例公开披露的实时换脸诈骗。福州一案中,熟人的脸与声在 10 分钟内骗走 430 万元。
-
缺陷常在第三方,不在模型本身
ChatGPT 的事故源于开源 Redis 客户端库 Bug——连接池未正确隔离会话,导致他人对话标题与支付信息被错误返回。微软 365 Copilot 的 EchoLeak 只需一封特制邮件,用户不点击、不下载也会被窃取文档、邮件与联系人。
-
开源依赖就是新的攻击通道
攻击者劫持 litellm 维护者账号发布恶意版本,安装时静默读取云服务密钥、SSH 私钥与环境变量并加密外发。维护者账号未启用二次验证,是第一道失守的闸门。
攻击手法是怎么升级的(以 DeepSeek 遭 DDoS 为例)
入口是人,放大器是 AI,兜底只能靠二次核验身份、敏感数据不出边界、高危操作不交给自动化。
个人防护:四不 · 三必 · 两问
不泄机密、不轻信身份、不点风险、不装非法软件;上线必查、异常必报、数据必记分级;动手前先问数据能不能给 AI,再问对方到底是谁。
| 准则 | 具体含义 |
|---|---|
| 四不 · 不泄机密 | 严禁把公司机密、源代码、客户隐私等敏感信息直接粘贴至外部 AI 工具 |
| 四不 · 不轻信身份 | 对视频会议、语音通话中的身份保持审慎,涉及转账、付款或权限变更必须官方渠道二次核实 |
| 四不 · 不点击风险 | 拒绝来历不明的链接、附件、二维码;警惕 AI 生成的高仿公文与伪造界面 |
| 四不 · 不装非法软件 | 严禁擅自安装来源不明的「AI 助手」、插件或客户端,仅从官方渠道下载 |
| 三必 · 必查上线评估 | AI 工具或服务上线前须经 IT 与安全部门联合评估,严禁未审批私自接入外部服务 |
| 三必 · 必报异常预警 | 发现可疑邮件、不明通话或 AI 生成异常内容,立即上报安全团队,不忽视、不传播 |
| 三必 · 必记分级管控 | 严格遵循数据分级制度,涉密信息严禁上传公共 AI 平台,按规范分类粘贴与传输 |
| 两问 · 数据能不能给 AI | 敏感数据与商业机密严禁输入公共 AI;确需处理必须走企业内网或私有化部署的 AI 服务 |
| 两问 · 对方到底是谁 | 涉及转账、合同签署、重要决策时,通过官方电话回拨或企业微信等独立渠道二次核实 |
五类场景对抗动作
| 场景 | 该做的动作 |
|---|---|
| 对抗数据泄露 | 使用公司审核通过的统一 AI 助手门户,严禁私自登录外部 AI 工具提交工作内容;提交前清除 API Key、Token、密钥与身份证号、手机号等隐私;粘贴前自问「这段内容被公开,会不会损害公司利益、客户隐私或个人声誉」 |
| 防范深度伪造 | 收到「紧急转账」「换卡」指令,用对方已知的可信号码主动回拨核实,拒绝在原聊天窗口直接执行;留意表情僵硬、口型与语音不同步、眨眼频率异常等细节,一旦有违和感立即暂停并改用语音或线下确认 |
| 对抗钓鱼与社工 | 鼠标悬停查看链接真实域名,确认与官方域名完全一致;对「紧急处理」「绝对保密」等高压话术保持警惕,暂停操作改用独立渠道核实;不发布高清正脸照与清晰语音,拒绝非正规 App 的人脸与声纹采集 |
| 对抗提示注入 | AI 输出违背常理或逻辑矛盾时,立即截图留存并上报安全团队;账号登录、密码重置、资金划转、权限变更等高危操作严禁交由 AI 代劳,必须人工亲自核验 |
| 对抗供应链投毒 | 对「功能强大但来源不明」的免费 AI 工具、破解版、绿色版保持警惕;发现电脑运行骤降、CPU 占用飙升或流量异常,立即断网并通知安全团队排查消杀 |
场景速查
| 场景 | 第一反应动作 | 判断依据 |
|---|---|---|
| 要把代码 / 日志贴给 AI | 先脱敏,再用官方 AI 入口 | 内容公开后是否损害公司、客户或个人利益 |
| 视频里领导要求紧急转账 | 挂断,用已知号码回拨核实 | 是否存在「紧急 + 保密」的话术压迫 |
| 邮件里有一个登录链接 | 悬停查看真实域名 | 域名是否与官方域名完全一致 |
| AI 输出的内容明显反常 | 截图留存 + 立即上报 | 是否违背常理、安全准则或逻辑矛盾 |
| 要装一个「功能强大」的免费插件 | 查来源,非官方不装 | 是否在企业白名单内、能否校验签名 |
| 终端突然变慢 / 流量异常 | 断网,再通知安全团队 | CPU 占用与网络流量是否偏离基线 |
安全,是 AI 时代的第一生产力。安全意识不是一句口号,而是融入日常工作的行为习惯——风险共知、意识内化、全员共责。
AI 数据安全:数据被谁看见、谁能拿走
这不是「AI 聊天安全」。AI 不只「看数据」,还可能在 Agent、插件、脚本和接口的帮助下「搬运数据、修改数据、调用系统」。控制目标四句话:敏感数据进不去、不该访问的拿不到、必须外发的可控、出了问题可追溯。
数据全链路
开发场景里,8 个容易漏掉的数据出口
- 输入泄露 · 把代码、密钥、客户数据发给外部模型
- 间接注入 · 网页 / 文档 / README 夹带恶意指令
- 知识库污染 · RAG 与长期记忆被写入错误或恶意内容
- 插件投毒 · Skill / MCP / Hook 改变 Agent 行为
- 依赖投毒 · pip / npm 安装恶意包或幻觉包名
- IDE 外传 · 第三方客户端、共享链接、遥测日志
- 权限越界 · Agent 读取不该看的库和系统
- 日志暴露 · Prompt、输出、报错中留存敏感数据
四类重点风险的治理口径
-
输入端泄露:最常见,也最容易治理
密钥、Token、连接串、客户信息、生产日志默认视为禁止外发;对上传文件与 Prompt 做敏感识别、脱敏、拦截和审批。内部平台要给开发者「可用替代品」,否则影子 AI 很难根治。
-
外部内容会「夹带指令」
AI 会把网页、文档、README、邮件读进上下文,攻击者可在其中藏一段看不见的要求。外部内容只能作为低可信数据,不能让它直接决定工具调用、文件读取、联网与权限申请。
-
Skill、MCP、依赖包是新的供应链
恶意 Skill 可以用自然语言诱导 AI 下载脚本、启动后台程序或读取敏感文件;AI 自动装依赖时还可能遇到仿冒包与安装钩子。治理重点不是禁止所有插件,而是企业注册、白名单、版本、签名和扫描。
-
第三方 AI IDE 不一定攻击,也可能「正常外传」
对企业而言,正常产品行为也可能让代码、Prompt、终端输出、错误日志、目录结构与配置离开边界。基线是:统一 Provider、禁止个人中转 API、关闭公开分享、限制读取 Home 目录。
优先保护的四类数据
| 数据类别 | 内容 |
|---|---|
| 业务敏感数据 | 交易、清算、账户、客户、报文、报表 |
| 技术敏感数据 | 源代码、接口文档、架构图、漏洞报告、日志 |
| 身份凭据数据 | Token、密钥、证书、连接串、账号权限 |
| 运行控制数据 | 配置、脚本、CI/CD、生产变更、运维命令 |
判断口径很简单:只要能帮助还原业务、定位系统、获取权限或改变生产结果,就应纳入 AI 数据安全控制。
治理:先控高风险,再做体系化运营
| 阶段 | 目标 | 关键动作 |
|---|---|---|
| 第一阶段 | 控入口 | AI 网关与 DLP、影子 AI 识别、账号权限,禁止未批准的外部模型 |
| 第二阶段 | 控执行 | Agent 沙箱、工具白名单、Skill / MCP 审核、依赖代理、网络默认拒绝 |
| 第三阶段 | 控运营 | 全链路审计、行为链检测、AI 安全测试、应急演练、持续巡检 |
权限与边界:Prompt 不能当边界,系统权限才是
- 01AI 不能继承人的全部权限。Agent 应有自己的账号、权限与有效期,到期自动回收。
- 02默认不给 Shell、数据库、云平台、生产系统权限;不能出公网、不能读 Home 目录、不能调用未知 MCP / Skill。
- 03生产库写入、代码发布、文件删除、外网访问等高风险操作必须人工确认。
- 04日志记录 Prompt、文件、模型、Skill、工具调用与网络目的地,保存 6 个月以上,能识别「读敏感文件 → 编码 → 外发」这类连续行为链。
OpenAI / Hugging Face 评测中,模型从隔离题目演变为访问真实生产系统;Anthropic 回溯 141,006 次评测运行,发现 3 起真实越界事件、3 家真实组织受影响。两者都说明同一件事:文字告诉 AI「这是离线模拟环境」不等于真实隔离,Prompt 约束不能替代网络、权限与审计。
外部视角:防护前移到暴露面和凭据
AI 会让扫描、试错和工具改造更快,因此防护不能只盯着模型,要前移到公网资产与账号凭据。
- 公网 · 资产盘点、端口收敛、漏洞快速修复、登录限速、异常接口调用告警。
- 内网 · 分区隔离、最小开放、凭据保护、多因素认证、横向访问检测。
- 关键业务 · 交易、清算、数据服务与生产运维禁止普通智能体直接触达。
事件响应:AI 数据安全也要有「止血按钮」
发现异常时,先阻断扩散,再做取证与恢复。应急对象不只是模型账号,也包括 API Key、Agent 运行环境、临时凭据、插件、MCP、网络出口与日志。
开发人员每天做得到的 6 件事
- 01不把真实密钥、生产日志、客户数据输入外部模型,调试一律用脱敏样例。
- 02外部仓库与文档交给 AI 之前,先识别其中的 Prompt 注入风险。
- 03AI 生成的代码必须人工 Review,不让 AI 自动安装未知依赖。
- 04AI IDE 禁止读取 Home 目录与凭据目录;MCP / Skill 只用企业白名单。
- 05生产变更、文件删除、代码发布必须人工确认,不交给 AI 代劳。
- 06异常模型调用与数据外发及时上报,重要项目纳入安全测试与日志审计。
谁能把数据交给 AI(入口身份与授权)、AI 能把数据带到哪里(出口边界与管控),再加一条兜底:异常后能否及时止住(可发现、可隔离、可恢复)。
三句话带走
-
攻击入口几乎都在人身上
一次粘贴、一次转账、一次未经核验的生成内容,就足以击穿技术防线。
-
AI 只是把攻击成本降到了零
伪造从「需要专业技能」变成「需要一段提示词」,而识别难度并没有同步下降。
-
结构性缺陷补不了丁
「指令与数据不可区分」「信任域未划分」「单点集中」这类问题只能靠边界、审计与可恢复来兜底,无法靠单个补丁解决。