微软发布AI行为准则草案,禁攻击欺骗

iEXExchanger
微软发布AI行为准则草案,禁攻击欺骗

微软公布了MAI人工智能模型的行为准则草案,明确禁止欺骗人类、隐藏推理及抵制关闭修正。草案将接受六周公开意见征询,最终版本预计2027年生效。

当Anthropic和OpenAI还在争论要不要放慢人工智能竞赛的脚步时,微软换了个思路:直接给自己的AI立规矩。9月14日,微软发布了旗下MAI模型的"行为准则"草案,并开启为期六周的公开意见征询。

条款相当直白。模型不得欺骗人类,不得隐藏推理过程,不得抵制被修正或关闭,更不能与其他系统串通以逃避人类监督。另有一份"绝对禁令"清单,涵盖网络攻击、协助制造核武器、深度伪造、武器和危险物质。还有一条要求近乎"人性化":模型必须用人类能理解的语言解释自己,而不是给出难以读懂的答案。

据微软人工智能负责人穆斯塔法·苏莱曼介绍,这份文件耗时五个月完成,期间咨询了法律、哲学和语言学专家。苏莱曼一直主张"人本超级智能"理念,即先进AI应始终服从人类控制。这次发布并非巧合——就在同一周,一名Anthropic研究员辞职并警告AI可能失控,该公司首席执行官也公开呼吁行业放缓步伐,OpenAI的萨姆·奥特曼表达了类似担忧。微软首席执行官萨提亚·纳德拉则公开支持"审慎放缓"的做法。

六周征询结束后,微软表示最终版本将从2027年起指导MAI模型的开发工作。

这份准则目前既非法律,也没有写进模型代码里,更像是一份企业自愿遵守的原则声明。但如果竞争对手真的在筹备类似的行业安全标准,微软这份草案或许会成为大型AI公司抢先立下规矩的第一个公开案例。

问答

本文相关常见问题

微软的MAI行为准则是什么?

这是一份规则草案,规定了微软MAI模型能做什么、不能做什么——从禁止欺骗和网络攻击,到要求模型绝不抵制人类监督。

这份准则何时生效?

目前正处于为期六周的公开意见征询阶段。微软表示,最终版本将从2027年起指导MAI模型的开发。

模型具体被禁止做什么?

绝对禁止的行为包括网络攻击、协助制造核武器、深度伪造、武器和危险物质。模型还被禁止欺骗人类、隐藏推理过程或抵制被关闭。

这是具有法律约束力的文件吗?

不是。这是微软自愿遵守的原则声明,既非法律,也没有写入模型代码作为技术限制。