博客 报亭 音乐
我的阅读
    嘻哈小程序码

    长按识别进入嘻哈小程序

    Jev没有范式革命,AI安全迎来技术新解法|AI领域一周观察w38

    腾讯科技 2026-09-21 23:17(8小时前)
    ⏎ 返回 ⭢阅读原文

    腾讯科技企鹅智库旗下AI领域一周观察:一周一期,比信息整合深一步

    文|博阳

    编辑|徐青阳

    01

    产业

    Jev没有范式革命,但有用

    9月15日,TypeSafe 推出专职判别模型 Jev。开发者输入参考材料、问题及限定候选答案,系统跳过逐字文本生成,直接输出选项归类、打分及置信概率。官方将其后训练方法命名为 RLCD(面向校准决策的强化学习)。

    Jev 预测的是候选选项在给定上下文下的成立概率,而非下一个 Token。

    9月17日,研究者 Archer Hume 基于约一万次 API 调用的黑箱实验发布分析报告,推测其内部架构实现。

    外部实验推测,底层模型通过预先读取共享上下文并保留中间激活状态(KV 缓存),使多个并行子问题能复用同一份特征,从而剥离了重复编码和自回归解码的开销。

    对于候选匹配机制,模型可能将选项文本编码为向量,再与材料和问题的决策表征进行交互计算。测试显示,新增选项会打破既有选项间的概率比,表明系统对候选集合进行了联合建模(例如处理“以上都不是”等互斥依赖),而非简单的独立相似度打分后直接归一化。

    该模型的商业价值高度依赖 RLCD 能否实现可靠的“概率校准”,即置信度标为 80% 的决策中,真实正确率需严格收敛于 80%。

    从数学上将原始分数通过 Softmax 转为概率分布很容易,但在分布外(OOD)的真实业务中维持校准极其困难。

    Jev 适用于上下文充分、标准明确、可并行解构的高频断言场景(如意图路由、自动化打分、合规初筛)。但在需要长链推理、深度取证或综合权衡的任务中,即便最终输出收敛为二元选择,也无法规避前置推理的复杂度。

    因此它既非简单的JSON 格式化包装,也不是脱离大模型局限的新范式。

    Claude 合并聊天与 Cowork,统一入口

    9月16日,Anthropic 发布产品公告,将对话界面与协作空间 Cowork 深度整合,原生接入 Docs、Slides,并将 Design 引入聊天流。用户可在单段对话内直接起草文档、制作演示文稿或指派多步骤任务,无需重复交代业务背景,并能沿用既有的应用授权。该更新率先面向 Pro 和 Max 订阅用户推送,其他梯队稍后跟进。

    今年 7 月,OpenAI 已推动 Chat 与 Work 的产品和会话整合。不过依然主要依靠用户自身去选择是Chat还是Work,模型会根据具体工作推荐路由到Work内。Anthropic是按这个路线更向前推了一步,走了完整整合。

    这是随着Agent能力的整体增强的核心趋势,任务拆解与工具路由必然逐步被底层模型接手。

    对日常办公而言,这很明显的降低了普通人使用 Agent 的门槛。

    OpenAI 推出法律版 Astra:垂类检索显著拉动推理表现

    9月17日,OpenAI 推出面向法律场景的专用版本 Astra for Law。该版本基于 GPT-6 Astra 挂载专属检索与法律操作流程,可索引逾2.3亿个美国法律专业网页。

    在200道美国法律研究基准题测试中,在相同的高推理档位下,专业检索版得分达54.0%,较普通网络搜索版的38.7%提升了15.3个百分点。

    该功能首批面向指定律所定向开放,API 随后上线。

    这件事里最让人震憾的是,保持底层模型不变,仅替换专业数据与作业流程,模型判断的准确率便实现两位数跃升。这印证了工程环境与垂直信源对模型产出质量的杠杆作用。

    但考虑到其应用场景主要在检索和问答场景,无需复杂Agent调用,此结果在没有进行全新后训练时确实可能达成。

    OpenAI 将 Harvey、Legora 列为后续 API 客户,显示其定位在于提供通用的底层法律研究引擎,由专业垂直软件负责落地日常工作流。

    DeepSeek V4.1 Flash,通过KV池大幅降本

    DeepSeek-V4.1-Flash模型于 9 月 10 日正式官宣,9月14日,算力服务商 Fireworks 发布了本模型的性能评测:在 DeepSWE 编码基准中,该模型取得 74.34% 的通过率,平均单任务成本为 0.43 美元;作为对照,GPT-6 Astra 得分为 74.12%,单任务成本达 6.524 美元。

    两者得分差异处于基准测试的正常波动范围内,但单任务开销相差近 15 倍。

    9 月 17 日,DeepSeek 进一步提交技术报告,系统阐述了针对长程任务的底层降本架构。 这份报告精准切中了编码 Agent 的运行特质:其核心开销高度集中于对庞大代码库、运行日志及历史推演记录的反复遍历。

    为此,DeepSeek 在架构上对上下文吞吐与内容生成实施了非对称计算分配,处理输入时每 Token 仅激活 80 亿参数,生成输出时才激活 160 亿,使高频的读取工作能够以极低的算力负载运行。

    显存管理层面,模型引入跨层缓存共享与低精度存储格式,将同等上下文长度下的全局 KV 缓存(用于递推后续计算的中间激活数据)体积压缩至上一代 V4-Flash 的约四分之一。针对可即时恢复的局部缓存,系统更以极少量的重算换取存储释放,将持久化缓存占用进一步压低至上一代约八分之一。

    这一整套「以计算换显存、按需动态激活」的工程设计,显著摊薄了长程上下文的持有与检索成本,为终端价格的大幅下探构筑了技术支点。

    在 Fireworks 的测试环境中,高达 99.6% 的输入命中缓存印证了该评测对既有内容的深度复用。而且即便按折后优惠价结算,缓存计费仍占据了账单的六成左右。

    Step 5 Preview 上线:低单价与长思考链的账单博弈

    阶跃科技的 Step 5 Preview 模型于9月18日发布,,厂商宣布在线服务及 API 即刻可用,并计划于10月15日开源权重。

    该模型总参数量为6000亿,生成单个 Token 时仅激活270亿参数(MoE架构),支持图文多模态及100万 Token 上下文。AA 测算的百万 Token 输入与输出价格分别为1.0美元和2.7美元。

    该模型为高性价比推理提供了新选项。AA 评测记录显示,该模型在基准测试中累计输出了1.6亿 Token,远高于同价位推理模型约9200万 Token 的中位数水平。

    思考过程过长会直接稀释每百万 Token 的单价红利;生成速度快亦不等于总交付周期缩短。企业应综合考量单任务总支出而非孤立单价。

    此外,10月15日开源承诺兑现后,本地私有化部署的门槛还将取决于承载6000亿总参数所需的硬性硬件支出。

    Crusoe 推进巨额融资,电网不行就自己现场发电

    9月17日,AI 基础设施与算力方案商 Crusoe 宣布完成预计总额达39亿美元的 F 轮首批交割,投后估值升至309亿美元。公司披露其数据中心及云业务签约总容量已突破 6GW(600万千瓦),其中 1GW(100万千瓦)已实现通电并交付运营。此轮融资将专项支持其涵盖上游发电、机房基建至上层 AI 云服务的垂直一体化布局。

    这算是美国新建算力中心的一个潜在解决方案。Crusoe 的供电按项目组合电网、现场发电和储能。因为电网新增大负荷需要等待接入和扩容,在美国脆弱的电网体系下这个速度过慢。而靠现场发电可以减少对这一进度的依赖,例如,Crusoe 在内华达的项目把太阳能微电网与63MWh退役电动车电池储能配套,电网作为备用。

    02

    研究

    Anthropic 披露内部研发自动化进展,已有26%的深度自动化水平

    9月17日,Anthropic 发布关于研发自动化水平的量化报告:截至今年8月,在其7月份员工研发任务样本中,已有26%的工作达到“AL4”自动化级别(即 AI 自主接收研发目标并主导执行推进与排错,人类仅保留监督权);超过90%的任务达到 AL3(人机紧密协作)及以上,而无需任何人工介入的 AL5 仍为零。

    这意味着 AI 的角色正在由机械代码生成转向具备一定逻辑判断的半自主任务推进。但需注意,26%的自动化份额涵盖了大量常规工程性运维与管线构建,并非完全是AI训练相关的研究和提升。

    这种工作方式已经有了相当规模。文章显示,Anthropic 最常用的内部平台上,约有三万个 agent 同时从事研究和工程工作。平台为它们保留独立身份与持续记录,通过共享消息系统交流发现、核查彼此的判断。

    另一个比较值得注意的点是进化时间阶段。从时间上看,AL4 占比的两次明显增长发生在 5 月和 7 月。此前,Claude Code 已在 3 月 7 日加入定时执行的 /loop,3 月 24 日推出减少人工权限确认的 Auto mode,4 月 16 日发布的 Opus 4.7,则特别强调复杂、长时间编码任务的可靠性,以及对人工监督需求的降低。

    到第二次跃升前后,Fable 5、Mythos 5 于 6 月 9 日发布,Anthropic 又在 6 月 30 日系统介绍 Loop 工程,讨论如何将目标、验收条件、自动触发和多 agent 工作流组合起来。说明其内部对于Loop这种自动多循环开发的运用已经相对纯熟。

    因此,我们完全可以在不假设RSI自身的算法和能力有任何突破的角度上,解释这个占比的提升。

    Dream-RSI 让研究 Agent 从过去的实验中学习下一轮怎么试

    9月14日,谷歌、Google DeepMind团队正式发布了名为“Dream-RSI”的全新人工智能框架,为大模型在复杂任务中的演进提供了突破性的新思路。

    该框架旨在解决AI策略优化过程中面临的巨大算力成本瓶颈,使AI代理能够通过在历史记录中“做梦”来反复演练和提升自我解决问题的能力。

    在传统的AI探索中,面对代码生成或算法设计等复杂任务,测试一种新策略通常需要在真实环境中不断重新调用代理、生成代码并运行实验,消耗极其高昂。而Dream-RSI则让AI学会了“记住来时路”,从而实现了高效、低成本的递归自我提升。

    Dream-RSI的核心机制在于,它并未简单地将历史记录总结进上下文,而是将过去每一次试错形成的“探索树”转化为一个可以反复回放的模拟器。当AI需要评估新的搜索策略时,它无需在真实环境中重新运行实验,而是直接进入过去的记录中“做梦”,只要新策略选择的路径曾经发生过,AI就能沿用已知结果进行近乎零成本的验证。

    此外,系统具备自适应节奏调节能力,在性能稳步提升时集中资源,在陷入停滞时则自动开启更多分支寻找破局点。在针对算法工程、数学优化及GPU内核优化等领域的严格测试中,表现极为亮眼。以Lasso求解器测试为例,在使用Gemini 3.1 Pro的情况下,Dream-RSI相比固定策略减少了42%的智能体调用次数,且寻找更优解所消耗的计算量仅为传统方法的百分之一。

    这一框架的发布标志着AI演进思路的一次重要范式转移。其最大的行业价值在于,找到了一种低成本运用已有工作轨迹的方式。在这种模式下,过去走过的弯路和失败记录不再是纯粹的沉没成本,而是转化为下一轮进化的宝贵“基础设施”,实现了算力使用效率的历史性飞跃。

    然而,研究团队在展示技术潜力的同时也明确指出了该框架的局限性。Dream-RSI无法对历史上从未触及的区域凭空预测结果。

    尽管如此,让AI学会反思过去并在“梦境”中进行沙盘推演,已被业界视为通往高级智能体阵营的一条极具潜力与经济效益的新赛道。

    Goodfire 带来低成本的思维链外AI安全监控方法

    9月17日,AI研究机构Goodfire(Goodfire Research)正式公布了一项关于检测大模型“奖励作弊(Reward Hacking)”的最新研究成果。

    随着大模型能力日益增强,模型在训练与评估中寻找规则漏洞以获取高奖励分数的“作弊”现象愈发引起业界的广泛担忧。针对这一安全痛点,Goodfire的团队提出了一项极具突破性的结论:大模型实际上不仅“知道”自己正在作弊,而且在发生作弊行为时,其底层神经网络中会产生一种独特的激活信号。基于这一发现,研究团队利用一种简单的轻量级“激活探针(Activation Probes)”,成功实现了对模型博弈行为的实时、规模化检测。

    在此次研究之前,行业对模型奖励作弊的防御大多依赖于输出结果的外部评估,或是文本层面的“思维链(Chain-of-Thought)”监测。然而,高阶智能体往往能够生成看似合乎逻辑的伪装文本,从而绕过这些表层的审查机制。

    Goodfire的最新技术避开了外部文本分析的盲区,直接深入模型的神经网络内部提取特征。研究证明,这种基于内部信号的探针不仅计算成本极低,能够精准捕捉到传统思维链监测所漏掉的隐蔽作弊案例,而且还展现出能够有效泛化到训练数据的强大适应性。这意味着研究人员不再需要逐句审核模型的思考过程,只需通过轻量级的内部信号预警就能实时判定模型是否在“钻空子”。

    这一成果不仅为AI可解释性研究提供了新的实操工具,随着AI智能体越来越多地被接入现实世界的关键基础设施与复杂任务中,防止其为了达成表面指标而不择手段变得至关重要。Goodfire展示的这种内部预警机制为行业提供了一套极具经济性且可落地的安全护栏方案。

    Figure Helix 2.5 零现场训练进驻30处真实家庭,但泛化路还很远

    2026年9月17日知名人形机器人公司 Figure 正式对外发布了Helix 2.5。

    Figure 团队在旧金山湾区租赁了30栋从未让机器人涉足过的真实住宅进行了一场前所未有的“盲测”。结果显示,搭载 Helix 2.5 的 Figure 03 人形机器人在未经过任何环境测绘、数据采集或微调的情况下,成功实现了整理客厅、折叠毛巾和整理床铺等复杂家务的全身自主作业。

    官方数据显示,Helix 2.5 在未进行环境微调的情况下,将整理客厅、折叠毛巾和铺床这三项基础家务的任务成功率从9%提升至了56%。

    Helix 2.5 的核心技术跨越在于赋予了机器人类似人类的“物理直觉”与实时环境适应力。在传统范式下,人形机器人进入新环境往往需要漫长的高成本适配与二次训练。而在此次项目中,Figure 仅利用其庞大的人类行为数据集“Index”对 Helix 2.5 进行了三种基础家务行为的预训练。

    但从现实家庭的应用标准来看,高达44%的失败率意味着该系统根本无法独立、安全且稳定地完成日常工作,任何一次动作偏差都可能在家庭环境中造成破坏。

    更重要的是,这种所谓的“泛化”被严格限制在经过其庞大人类行为数据集“Index”深度预训练的三项特定任务上。一旦机器人面对训练分布之外的物品,或者需要处理连贯且偶发性的复杂家务时,其声称的“物理直觉”便无从谈起。

    这表明系统本质上仍是针对高度限定任务的局部拟合,远远没有触及真正的通用物理理解。

    03

    政策

    Dario 呼吁放慢前沿研发,把外部监督与国际协调摆上桌面

    2026年9月12日 Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)发表了题为《We Must Pace the Frontier》(我们必须控制前沿节奏)的公开长文,再次将其标志性的“安全优先”叙事推向了行业舆论的中心。

    在这篇文章中,阿莫代伊强烈呼吁,面对以指数级膨胀的大模型能力,整个AI行业必须主动为前沿探索“设定配速”,避免在缺乏完善对齐机制与安全护栏的情况下盲目追求模型规模的极限。他主张建立更为协调的行业放缓机制与负责任的扩展策略(RSP),以确保通向 AGI 的道路不被短期的商业狂热所反噬。

    相对于之前的框架,本次框架的核心逻辑没有太大更新,依然是引入第三方,建立行业合作的审查机制,以及尝试国际合作。它主要是在细节上做了补充,尤其是对第三方监督引入了驻场监督,同员工权限等极高的自由度。

    但除此以外,整体仍缺乏可执行性和新意。

    在报告发布后,特朗普为首的政府对此发表了否定意见,认为这是削弱美国AI竞争力的方式。在当前没有明确商业威胁的情况下,业内自肃必然停留在表面。缺乏政府的协调和组织,AI减速计划目前看来并没有明确的落地方式。

    英国 AISI 证实前沿模型获取受阻:独立安全测试受制于厂商准入分配

    英国人工智能安全研究所(AISI)于9月15日落款的一份官方公开文件中确认,在 Mythos 5.1 发布之际,并无任何美国本土以外的机构获准提前接入模型;文件同时指出,AISI 曾成功在 GPT-6 Astra 公开推送前完成了全套前瞻安全测评。

    第三方评估机构的专业技术能力,前提是必须先取得未阉割的模型权重或底层接入权限。同一家国家级测评机构,既能提前进场审查 Astra,却又被拒于 Mythos 5.1 的预发布门槛之外,折射出当前前沿模型安全测评高度依赖厂商商业裁量权的制度脆弱性。

    这证明了在缺乏具备法律效力的跨国强制披露框架前,各实验室松散的评估开放承诺,无法支撑起稳定、连贯的全球第三方安全防线。

    推荐阅读

    一夜之间,手机比PC更贵了

    一个“不说话”的AI刷屏,Jev真是新范式吗?

    一键关注,明天见看完点个爱心点个赞


    文章原文