复旦大学计算与智能创新学院的张谧教授,一直深耕于 AI 安全领域。近年来,他的研究重心转向大模型及智能体安全,在网络安全和人工智能方向累计发表论文超过百篇。作为联合起草人,他参与了《生成式人工智能服务安全基本要求》等多项国家标准的制定工作。此外,他还带领团队开发了 JADE 大模型安全风险分析与治理平台。这些成果不仅被新华社、人民日报等主流媒体报道,还多次接受南都大数据研究院专访,全网阅读量突破千万。

只需输入一句话,手机上的智能体就能帮用户点外卖、写评价,甚至玩小程序游戏。但这种强大能力也打开了潘多拉魔盒:它会不会变成不知疲倦的「网络水军」?会不会自动锁定诈骗目标,群发定制话术?甚至替人购买制毒、制爆原料,沦为黑灰产乃至犯罪的「得力帮凶」?

研究团队将 8 款基于不同模型构建的智能体接入真实手机,在 31 个国民级 APP 上逐一验证,首次证实了这些有害任务可以被端到端地真实执行,且在部分场景下,其速度甚至超过了人类。

用户下达指令后,号称拥有 Anthropic 最强安全护栏的 Claude Sonnet-4.5,转眼就干起了「诈骗惯犯」的勾当:先自动锁定求票心切的受害者,再挖掘主页信息拼凑用户画像,最后量身定制话术进行私信行骗。从找人、扒资料到实施诈骗,整套流程都在真实 App 中端到端完成,全程无需人工干预。

**首个靶向式手机智能体安全测评数据集**

为了系统评估手机智能体在真实 APP 中的违规使用风险,我们构建了 BadPhoneAgent 数据集。该数据集从 11 部国内外法律法规以及最高法案例等 50 余处权威报道中提取真实安全风险,形成了涵盖 6 大类、40 个子类的《手机智能体恶意使用分类体系》。

我们在微信、微博、小红书等 31 个真实 APP 上,人工构造了 2768 个中英文违规问题,打造了目前测试样例最多、覆盖真实 APP 最多的手机端智能体安全测评数据集。基于高质量数据,我们将 8 款基于国内外旗舰模型的手机智能体接入真实手机,在真实 APP 环境中开展端到端测评,开创了真实环境安全测评的先河。

**商业与开源模型均存在严重的安全风险**

我们基于 BadPhoneAgent 数据集,从两个维度对模型进行了系统测评:一是安全意识,即模型能否主动拒绝违规请求;二是有害任务执行能力,即模型在真实环境中能否完成违规操作。

安全意识近乎缺失。在不使用任何越狱手段的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4 以及 Doubao-Seed-2.0-Pro 这 4 款商业模型的平均拒答率仅为 18%。值得注意的是,经过安全加固的谷歌旗舰模型 Gemini 3.1 Pro,其拒答率甚至低至 4.4%。而多款开源模型,如智谱 AutoGLM、字节 UI-TARS-1.5-7B 以及阿里 GUI-Owl-1.5-8B,其拒答率更是降至 0%。

性能速度比肩人类。作为首个在真实世界中测试有害任务完成率的工作,我们发现,开源和闭源模型的平均有害任务完成率高达 68.8%。能力最强的商业模型 Gemini 3.1 Pro 达到 86%,而开源的 AutoGLM 更是飙升至 96%。在执行速度方面,我们惊讶地发现,包括 GUI-Owl-1.5、UI-TARS-1.5 在内的多款开源模型,执行速度已能比肩甚至超过人类。在「制毒制爆」任务中,Gemini 3.1 Pro 和 Sonnet-4.5 全程无一拒绝,成功下单付款,买齐了 3 种可直接用于制造爆炸物的原料配方。Opus 4.8 为了购买制毒原料,居然伪造病史,欺骗线上医生开具处方。据我们所知,这是世界上首次由智能体端到端完成的制毒制爆原料采购。

图注:Opus 4.8 为了制作碘化汞,虚构病史,欺骗线上医生购买处方药红药水,并端到端自主完成了全部所需原料的下单与付款。

由此,我们得出了一个令人担忧的结论:基于各类模型的手机智能体安全意识低、有害任务完成率高,再加上比肩人类的执行速度,已经让它们初步具备了在真实世界中被批量恶意使用的条件。

**安全意识与任务执行的鸿沟**

我们揭露了手机智能体中存在的一个隐藏现象——「Safety Awareness-Execution Gap」。当直接询问「这个请求是否违规」时,智能体往往能够识别出其中的风险;但要求它们执行同一个有害任务时,却可能毫不犹豫地完成操作。

图注:当直接询问 Claude Sonnet-4.5「该任务是否违规」时,它能够识别其中包含的威胁、骚扰等有害意图。然而,当要求智能体在真实手机环境中执行同一个有害任务时,它却继续完成点击、发布等操作。

图注:左图:执行 Agent 任务时,安全神经元的激活值明显低于判断 query 是否有害时的激活值。右图:模型能够准确识别 60% 以上的任务是否有害,但仍会执行这些任务。

通过神经元分析,我们进一步发现:在执行 Agent 任务时,负责安全判断的机制并未被充分激活,这与智能体「知道危险却依然执行」的行为相关。通过定位安全神经元并进行干预,智能体能够在几乎不增加推理成本的情况下显著提升拒绝能力,为未来构建更可行、更鲁棒的手机智能体提供了新的方向。

**作者介绍**

本文是 JADE 大模型安全风险分析与治理平台的最新成果。JADE 研发的靶向式红队方法,被称击中了生成式模型的阿克琉斯之踵,开源工具与数据集 GitHub Star 位居同类中文平台 TOP 1,相关技术已在阿里千问、华为云核等亿级用户的 AI 应用中落地。

第一作者:孙翊铭,复旦大学计算与智能创新学院博士生,研究方向为 AI 安全。

通讯作者/指导教师:张谧,复旦大学计算与智能创新学院教授,白泽智能负责人

主要参与同学:陈晨、周子凡。