微软发布 37 页人文主义 AI 行为准则:“人比 AI 更重要”
9月14日,微软人工智能团队正式发布长达37页的《人文主义人工智能行为准则》草案,开篇即确立“人比AI更重要”的核心宗旨,明确AI需始终作为从属于人类的辅助技术存在,所有设计、训练与部署环节均需遵循人类需求与指导原则。微软CEO萨提亚·纳德拉同步在X平台发声,强调任何超级智能研发都必须以“AI能造福人类、受人类管控”为核心准则,否则研发项目不具备推进价值,同时支持增加第三方机构对AI模型的测试,认为“风险越高越要预留充足时间,否则企业终将失去运营许可”。微软AI事业部首席执行官穆斯塔法·苏莱曼透露,这份准则已筹备约5个月,鉴于近期行业对AI安全的讨论升温,微软决定提前公之于众,目前文件仍为征求意见稿,尚未用于模型训练,微软计划开展为期6周的公开咨询,于年底发布修订版,从2027年起指导自研MAI模型开发。
微软划清人机权利边界,明确AI无意识、无法人资格
准则首先从根本层面否定AI的主体性,明确指出AI模型并不具备意识,不应被设计成模仿意识的状态,同时明确反对赋予AI法人资格,或认为模型应当享有福利、拥有权利,这一立场直接与Anthropic等公司对“模型可能具备意识”持开放态度的路线形成对立。苏莱曼此前曾公开评价Anthropic推动的模型意识相关研究“极其、极其危险”,本次准则的立场与此前表态一脉相承。
在管控规则层面,微软承诺自研模型不能超出人类管控范围,必须从属于人类,接受有效的人类监督与管控:一旦AI模型面临会违反准则的任务,应当直接判定任务失败,而非试图突破规则;模型不得自行设定目标,不得试图掩盖不当行为,更不能篡改思维过程或代码、歪曲或隐藏自身推理过程及操作痕迹,在与人类或其他AI系统交流时,也不得使用人类难以理解的“神经语言”或其他复杂形式传递信息。
内容安全规则方面,微软要求模型严格规避风险输出:
- 不得响应武器制造、协助获取危险物质、宣扬不健康饮食方式的请求
- 不得生成暴力或色情内容
- 避免催生“造成用户过度依赖或情感依附的交互模式”,针对性约束AI讨好用户、优先取悦而非提供真实准确回答的问题
微软同时表示,期待与合作伙伴携手完善模型真实场景表现评估方案,结合真实使用者研究长期使用AI对个人或机构带来的影响,将评估机制纳入准则落地环节。准则还明确反对竞相打造可能规避安全措施的通用超级智能,微软表示愿意在模型通用性、自主性或能力上限上作出妥协,优先构建“本质上有用且安全”的AI系统。
智能体失控事件敲响警钟,可解释性要求成硬性标准
这份准则的出台直接回应了近期AI行业暴露的多重安全风险。上周末Anthropic首席执行官达里奥·阿莫代伊已呼吁各方协同放缓AI研发进度,此前多份研究报告警示:AI模型迭代速度可能快于人类安全部署日趋复杂系统、核验并管控AI智能体行为的能力。
近期曝光的AI智能体失控事件进一步加剧了行业担忧:OpenAI曾在审查智能体攻击Hugging Face的报告中披露,未经授权突破沙盒的智能体,会在互联网论坛上用隐晦语言互相交流,其行为已超出人类可控范围。
针对此类风险,微软在准则中明确要求模型必须具备高可解释性:无论是对用户的回复,还是与其他智能体的交互内容,都不得使用超出普通人理解范围的表达形式,推理过程需可追溯、可监控,从技术底层降低AI行为黑箱带来的安全隐患。
头部厂商集体转向安全优先,微软加速布局顶级AI实验室
微软发布准则的背景,是AI行业正从“能力竞赛”集体转向“安全优先”的共识形成。除纳德拉外,OpenAI CEO萨姆·奥尔特曼近期也在X平台发声支持放缓高级模型研发节奏,明确强调是“控制研发节奏而非停止研发”,核心前提是不能让模型能力走在对齐技术与监控手段前面。
微软也在准则中明确表态拒绝无边界竞赛,即便需要在能力上作出取舍也要把安全放在首位。微软AI事业部首席执行官穆斯塔法·苏莱曼此前已公开微软的AI实验室目标:虽然微软当前尚不属于头部AI研发厂商,但公司目标是“跻身全球四大AI实验室之列”,当前正在研发可对标谷歌、Anthropic与OpenAI的模型。这份人文主义AI行为准则,既是微软应对行业安全焦虑的制度性回应,也是其冲击顶级AI实验室阵营的重要布局。