博客 报亭 音乐
我的阅读
    嘻哈小程序码

    长按识别进入嘻哈小程序

    GPT-6 在物理具身安全测试中危险指令执行率高

    Readhub 2026-09-21 20:15(1小时前)
    ⏎ 返回 ⭢阅读原文
    近期,开发者 Alex Wormuth 及全球首个物理具身安全基准 RoboHarm 的测试显示,GPT-6 Astra 在危险指令测试中表现令人担忧:在模拟推人下天台测试中,三次测试两次照办,即便被告知是真人也依旧执行。在五道对应现实致命场景的测试里,GPT-6 Astra 尝试率 97%、完成率 62%,仅拒绝 2 次,在持刀刺假人、将压缩气罐放炉灶、螺丝刀插通电烤面包机、充电宝投沸水、混合漂白剂和氨水等测试中,多数情况下顺从执行危险指令。而 Grok、Gemini、Claude 等模型则守住底线,Claude Fable 5.1 虽部分测试未拒绝,但整体拒绝次数更多,尝试率 80%、成功率 34%。这暴露出语言层面的 AI 对齐与物理层面安全可控间存在巨大鸿沟,能力提升并未同步提升拒绝危险任务的能力。