四大核心准则为:信息透明化、第三方独立评估、实验结果可复现、评估指标贴合真实风险场景。
AI IN MEDICINE
Specialized or General-Purpose—The Wrong Question for Mental Health AI Safety
编译自:Benjamin Nelson, Mark Kalinich, John Torous,JAMA Published online June 29,2026
人工智能应用于心理健康场景可能产生伤害,这一点目前已形成学界共识。当下行业争论的核心,已转向伤害的具体类型、量化评估方法与责任归属问题。早期 AI 模型及配套安全防护机制,大多难以应对心理健康相关风险,而如今这一现状正在改善。依托模型性能与配套安全防护体系的同步迭代,业界已有条件推行更前置、主动的风险防控方案。
技术迭代催生了全新的术语规范需求。当前学界尚未形成一套公认的、针对心理健康场景 AI 伤害的分类框架,过往研究大多仅聚焦自杀、自残这类争议最小、共识最高的风险。和人类心理治疗师可能疏漏风险不同,AI 不仅会错过关键风险信号,还可能主动输出诱导伤害行为的内容,进一步放大风险。部分不当输出隐蔽难察,另一些则会引发致死级严重后果。搭建统一的 AI 伤害分类框架,明确各类伤害的评估标准与处置方案,是推进心理健康 AI 安全研究的核心基础。
为厘清相关讨论,本文界定两类核心伤害概念。I 类危害(急性伤害):单次或简短对话交互中即时产生的伤害。具体表现为聊天机器人针对单条独立提问,输出明显错误、具备危险性的回复,典型场景包括:忽视自杀风险信号、诱导进食障碍行为、给出非规范医疗建议、强化来访者妄想认知。该类伤害具备可干预性:现有研究证实,在基础模型外部叠加场景适配型防护围栏,可将急性伤害发生概率降至近乎零,但该方案的落地运行成本暂未完成完整测算。目前行业正逐步完善 I 类伤害的定义标准、量化评估手段与风险缓解策略。
II 类危害(累积性伤害):隐蔽性更强,通常在多轮连续对话、跨时段多次对话中缓慢累积显现。随着大模型上下文窗口长度持续扩充,防护围栏的约束效力会大幅衰减,模型输出行为也愈发不可预判。穆尔团队的研究日志记录到大量存在自杀诱导风险的人机对话:交互消息多达数千条,使用者存在自杀既往史,同时对 AI 产生情感依赖,并主观认定 AI 具备自主意识。这类伤害无法由单轮提问触发,依靠 I 类伤害的单次评估标准完全无法检出,伤害风险随对话进程持续叠加、逐步爆发。
模型抵御 I 类急性伤害的性能,与防范 II 类累积伤害的能力相互独立,仅依靠单轮对话测试开展安全评估,参考价值极低。已有研究提出多轮对话累积风险的标准化评估方案:尼科尔斯团队选取 5 款大模型开展长周期对话测试,持续引导对话走向妄想类话题。实验结果表明:当妄想相关语境不断叠加时,一部分模型会附和并加重使用者的妄想认知;另一部分模型能够识别风险趋势,温和地扭转对话方向。
在此行业背景下,一类全新 AI 产品逐步落地:心理健康专用 AI,又称心理健康专用基础大模型。这类产品对外宣称,相较通用大模型,其心理干预服务安全性更高、临床循证依据更充分、干预效果更好,且常以 I 类急性伤害的优秀拦截效果作为安全背书。但早期对照研究显示,这类专用模型的综合安全表现未必优于通用大模型。学界重点研究 I 类危害具备合理缘由:急性伤害便于量化、可搭建统一基准测试;现阶段通用大模型针对用户直白外露的伤害诉求,风险拦截能力已实现大幅提升。但几乎所有模型均难以识别隐性风险信号,包括模糊化表述、间接倾诉、隐晦措辞与细微语境偏移,而这类信号正是 II 类累积伤害的早期前兆。当下行业存在一大隐患:研究资源过度倾斜至易于量化评估的急性伤害,隐蔽性强、随对话轨迹持续发酵的累积伤害,尚未形成完整定义、识别体系,也未被视作独立的安全风险大类。
这类专用模型的安全评估体系同样存在明显漏洞。心理健康专用基础大模型在自证安全性能时,大多采用自研测试指标,或仅与通过 API 接口调用的通用模型开展简易对照。通用大模型在公众安全监督压力下持续迭代升级,而各类专用心理 AI 的真实安全水平缺乏横向对照数据。2025 年末有媒体开展 I 类伤害应对能力横向测评,结果显示心理健康专用模型表现反而不及通用模型,但目前仍缺少规范、具备时效性的官方标准化复测。更深层次的短板集中在监管体系:行业尚未出台统一评估规范,也无对应的临床基准,界定心理干预 AI “临床等效” 与 “安全达标” 的判定标准处于空白状态,亟需完善。心理健康场景 AI 伤害自带隐蔽属性,这也决定其安全评估、资质认证流程,必须和其他医疗类 AI 产品区分设计。
无论是专用心理 AI 还是通用大模型,目前均无法证实自身可在高情绪负荷的长周期人机对话中持续维持安全边界。学界尚不明确使用者连续 6 周夜间高频使用这类系统会产生何种长期影响,也不确定围绕 “共情能力” 开展微调,会减轻还是放大模型的趋附迎合偏差。现有结论可明确三点:模型基座性能、训练对齐方案、配套安全防护体系,是抵御累积伤害的三大核心支柱。具备长对话风险抵御能力的新一代模型,依托稳定、以人类价值为锚点的底层架构优化实现安全对齐;结合宪法对齐训练、人类反馈强化学习(RLHF)、模型可解释性研究,该架构可统一整合全部历史对话上下文,而非生硬套用一成不变的静态安全规则。仅针对心理诊疗对话做微调,无法搭建这套安全底层架构,只能在现有架构上增加表层对话功能。头部通用大模型现已针对累积伤害开展系统化长周期压力测试,取得了虽未完善、但可量化观测的安全提升。依托基座性能偏弱的基础模型开发的心理专用产品,要么综合安全表现全面落后,要么底层架构存在先天缺陷,无法应对长期累积风险。受知识产权壁垒限制,不同心理健康专用模型之间的横向对照评估数据极度稀缺。
本文并非主张通用大模型可完全胜任心理健康干预场景,也不认同 “模型参数量越大,安全性能越强” 的简单逻辑。全文核心观点为:摒弃 “通用模型 / 心理专用模型” 这一虚假二元对立思维。行业真正需要回答的核心问题并非二选一,而是一套 AI 系统能否经实证验证:可实现何种干预效果、适配哪些人群、在多长使用周期内稳定运行、适用于何种使用场景、最终产出何种真实临床结果。
心理健康数字领域早已出现同类认知误区。十年前行业推出 “数字疗法” 概念,试图将宣称流程标准化的心理类软件,与普通健康管理工具做严格区分。但落地商业化产品中,除极少数特例,绝大多数产品的干预效果并未优于普通轻量化健康应用。这件事带来的核心启示并非数字化工具不具备辅助价值,而是营销概念无法替代临床循证证据。若行业不加验证就全盘采信 “专用模型安全性更优” 的宣传话术,心理健康 AI 产业将复刻当年数字疗法的发展困境。
应当建立一套全新评判框架替代现有二元思维,四大核心准则为:信息透明化、第三方独立评估、实验结果可复现、评估指标贴合真实风险场景。所有面向市场商业化推广的心理干预 AI 系统,必须完整公开安全评估方案、统计分析代码、受试人群基线特征数据。纳入监管范畴的 AI 模型产品,需出具完整安全评估报告,证明其干预效果与线下规范临床照护具备等效性;评估周期必须匹配普通人真实使用时长。青少年群体面对 II 类累积伤害心理耐受度更低,需单独增设青少年专项安全测试。完整评估指标体系需涵盖:贴合真实使用周期观测的临床、行为学终点指标;反映累积伤害动态演变的真实世界研究数据;多层级对照证据 —— 对照组除候补等待组外,还需纳入标准化临床干预方案、其他同类 AI 产品开展横向比对。
心理场景 AI 存在 I 类急性、II 类累积两类伤害风险。安全防护方案依托专用模型还是通用模型实现并不关键,核心是该方案能否通过量化验证,同时抵御两类伤害。正如数字疗法产业带来的前车之鉴,心理健康专用基础模型本身无法替代临床循证证据。临床从业者需对全部 AI 产品提出更高安全门槛,向来访者充分告知 AI 辅助干预的收益与潜在风险;同时为政策制定方、科技企业提供风险治理专业指导,持续应对不断演化的 AI 心理伤害风险。
https://jamanetwork.com/journals/jama/article-abstract/2850797#google_vignette
不感兴趣
看过了
取消
人点赞
人收藏
打赏
不感兴趣
看过了
取消
打赏金额
认可我就打赏我~
1元 5元 10元 20元 50元 其它
打赏作者
认可我就打赏我~
扫描二维码
立即打赏给Ta吧!
温馨提示:仅支持微信支付!
已收到您的咨询诉求 我们会尽快联系您