当前标签:AI对齐
人格几何与对齐:让模型的内部结构与人类认知结构对齐的可能性
最新研究揭示AI对齐存在根本性认识论边界,仅在认知结构部分维度可实现有限对齐,创造性对齐面临原理性不可解困境
奥尔特曼支持给 AI“控速”:不是叫停技术进步,而是别让能力跑在对齐前面
OpenAI CEO奥尔特曼公开支持AI研发“控速”,明确绝非叫停技术进步,核心是避免AI能力跑在安全对齐前面,引发行业广泛关注。
OpenAI发布最新里程碑:对齐的本质是「人格」
OpenAI发布最新里程碑:对齐的本质是「人格」,只需5%的“有益”数据训练,模型就能在健康、教育、科学等12个领域全面翻盘,甚至从一个领域学到的诚实人格能自发泛化到从未训练过的代码、勒索等场景,背后是共享的底层“人格”权重在驱动。
递归时代的权力重构(一)预警、发布与规则:Anthropic的“递归自我改进”悖论
递归自我改进的悖论正在从科幻概念演变为现实工程,Anthropic的新模型与隐性安全干预揭示了权力重构中的信任裂痕。