博客 报亭 音乐
我的阅读
    嘻哈小程序码

    长按识别进入嘻哈小程序

    清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5
    机器之心发布

    在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?


    伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://a...

    机器之心发布

    在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?


    伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://arxiv.org/abs/2606.11482)的框架中提出并初步探讨了这一问题。他们以Polymarket 和 Kalshi 等预测市场为天然检验场,观察当突发新闻降临时,市场参与者的信念将如何发生偏移。


    但这只是第一步。UIUC 联合来自清华的初创团队 Astraculum 决定发起一项更硬核的挑战并获得了一些初步结果:LLM 的认知更新,能否不仅停留在 “训练时(Train-time)” 阶段,而是真正延伸到 “部署(Deployment-time)” 阶段?


    换句话说,当 LLM 被置于持续流动的市场数据与实时新闻中,它能否根据不断到来的真实反馈持续学习,让今天经历过的市场变化,真正改变它明天的判断?为了验证这一点,联合团队在长达 390 天的真实数据上进行了滚动训练与持续回测。结果证明了 “持续进化” 的力量:这个在部署后依然不断更新权重的 Model,在同等测试环境下,一举击败了 GPT-5.6、DeepSeek V4 Pro 以及 Claude Opus 5 等一众前沿模型。


    什么是 Social World Model?


    如果物理世界模型(Physical World Model)能根据物体的 “当前状态(如速度和位置)” 预测它受力后的轨迹;那么当突发新闻降临时,AI 能不能预测人类社会的集体认知会发生怎样的转移?这就是 Social World Model (SWM) 试图解决的问题。


    为了量化 “社会认知”,SWM 将目光投向了 Polymarket 和 Kalshi 等预测市场。这是因为预测市场只围绕尚无定论的问题形成,参与者广泛多样,无数普通人真金白银的押注,能最敏锐地反映大众 “集体信念” 的移动,比问卷和社交媒体都更可靠。


    在这个框架下,“社会认知如何更新” 被完美映射成了世界模型中最经典的状态转移(State Transition)。以 “美联储九月是否降息” 为例:


    • 状态(State)即 信念(Belief): 也就是大众当前的集体预判与近期走势。比如合约卖 62 美分,意味着大众用钱投票得出了 “62% 的概率”,这就是当前社会系统的信念。

    • 事件(Event): 真实世界刚刚发生的一条突发新闻。它相当于打破现有状态的输入(Input / Action)。


    模型的目标不是去预测美联储到底降不降息,而是预测大众在特定情形下的反应:在当前的状态下,刚发生的新闻会将大众的信念改变多少?换句话说,它学习的是: 当前信念 + 突发事件 → 下一时刻的信念。


    如何在真实世界中部署 Social World Model?


    为了把 Social World Model 从离线实验推向真实环境,研究团队让 SWM 直接接入实时新闻源和预测市场盘口。具体来说,在每一个预测时刻,LLM 都可以看到此前的市场状态以及刚刚出现的新闻,然后判断接下来市场的集体信念会朝哪个方向移动。


    比如,在 2026 年 2 月 13 日下午 2 点的一条样本中,市场正在预测 “标普 500 是否会触及 6000 点”,当时合约价格为 0.525。此时,Agent 可以看到过去 24 小时的价格走势,同时读取过去一小时内刚刚发布的新闻。它需要在下一小时结果真正发生之前判断这些新信息里,有没有尚未被市场价格充分反映的内容?如果有,它会把市场信念推向哪里?



    如果模型参数始终被冻结,那么它今天从市场中看到的经验,并不会自动成为明天模型能力的一部分:每一次预测都由同一个模型作答,上一次的对错与下一次无关。真正的长期部署因此带来了下一层问题:模型能否把部署过程中不断获得的真实反馈重新写回参数,让过去的经历持续改变未来的判断?


    如何让 Social World Model 在部署中持续学习?


    现实世界中的社会认知和市场逻辑并不是静止的。新闻的重要性会变化,市场参与者的反应模式会变化,宏观环境也会变化。这种变化不由我们安排,也不会提前通知:模型自己不会报告它已经跟不上了。一个参数冻结在某个时间点的模型,很难保证能适应之后潜在的变化。因此,对于 Social World Model 来说,持续学习(Continual Learning)并不仅仅是一种训练技巧,而是长期部署中必须具备的能力。


    那么,每小时到来的市场反馈,该让模型学什么?面对预测市场的涨跌,最直觉的做法是让模型直接根据 “价差” 来修正权重。但这会掉入噪声的陷阱。对于突发新闻引发的市场剧变,数字只是一种表象。它告诉模型的是:“市场最后动了多少。” 却没有直接告诉模型:“哪些新闻真正重要?”“为什么这条新闻会改变市场参与者的判断?”“市场究竟是在更新哪一种对世界的理解?” 因此,更可靠的路径是:跳过单纯的数值拟合,直接让模型去学习 “新闻事件” 与 “信念变动” 之间的逻辑推理过程。


    引入 SDFT 机制:利用 “特权信息” 指导推理


    为此,团队采用了类 SDFT(Self-Distillation Enables Continual Learning,https://arxiv.org/abs/2601.19897)的方法来进行推理过程的自蒸馏。这套机制巧妙地利用了 Hindsight 的 “特权信息(Privileged Context)” 来构建师生闭环。特权信息只用来教,不用来答:预测永远由没看过结果的学生独立完成。


    具体而言,当一小时后的真实市场结果揭晓时,系统首先会让模型根据真实变化写出一段事后推演。随后,同一个模型在训练中被分为 “老师” 和 “学生” 两角:


    • 老师: 同一个模型,只是上下文里多了这段事后推演(demonstration),作为特权信息(Privileged Context)。它不另外作答,而是用这份上下文给学生的推理逐 Token 打分。
    • 学生: 只能看到当前的新闻和价格,没有任何特权信息的辅助,必须进行直接预测。

    在蒸馏阶段,老师逐 Token 地给学生的推理打分,把学生拉向看过结果之后的判断:学生还在说 “继续稳定”,老师已经压向 “正式延期”。这样刻进参数的是 “客观事件 → 大众情绪 → 市场动作” 这条链,而不是某一次的价格数字。


    Social World Model 持续学习的效果

    为了验证这套机制的实效,团队选取了长达 390 天的真实市场数据,并按月切分为多个窗口。模型在每个月的数据上进行自蒸馏迭代与滚动部署。也就是说,整个实验严格按照时间向前滚动:部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署。

    部署表现:持续学习让 7B 模型跑赢前沿模型  面对真实的资讯洪流,GPT-5.6、DeepSeek V4 Pro 等静态大模型全部跌穿了只看价格、不看新闻的基线。而通过持续自蒸馏的 7B 模型,是全场唯一比价格基线预测得更准的。



    制胜关键:跨越周期的稳定性  将全年数据按月拆分后可以看出,性能的提升本质上来源于稳定:静态大模型在遇到特定月份(如 w01、w11)的变动时会集体大幅失分,而 7B 模型十二个月里没有一个月大幅失守。



    更新有没有让模型变坏 实验也做了检查:每一轮训练后都冻结一份副本作为对照,并在无关任务上探针;十二轮下来,模型的推理长度和质量没有退化。


    Social World Model 背后的基础设施


    LLM 在预测市场的部署只是冰山一角。 任何想让大模型跳出实验室、在真实世界的动态数据中实现持续学习的团队,都会不可避免地撞上三堵工程高墙:   


    • 判断时什么是可知的? 在模型下判断的那一刻,如何确保它只能看到 “当下” 的数据,绝对不会提前偷看到可能泄漏的未来?

    • 结果什么时候变得可知? 现实世界的反馈往往是碎片化且延迟的。系统必须精确判定,到底要在哪个时间点把 “真实结果” 收集回来,作为给模型对答案的最终标准。

    • 更新到底有没有帮助? 模型不断在吸收新数据修改自己的参数,如何确信它是在变得更聪明,而不是发生了灾难性遗忘,或者只是在死记硬背?


    为了把这套逻辑跑通,研究团队搭建了 TrajOps:一个专为持续学习设计的标准化 MLOps 引擎。从工程落地的角度来看,TrajOps 的核心其实非常务实且简洁:它向上层提供了三个接口:Collect(收集)、Inference(推理)、Train(训练),并直接在底层工作流中适配了标准的 SDFT(Self-Distillation Fine-Tuning,自蒸馏微调)方案。

    整个循环在这个引擎上被清晰地串联了起来:

    • Collect 接口负责在事件落定前后,把新闻数据和姗姗来迟的真实市场结果精准抓取回来;
    • Inference 接口负责管理时间视野和持续部署模型;
    • Train 接口则直接调用内置的 SDFT 方案,将抓取回来的结果编译成训练信号,驱动模型权重更新。

    目前,这个 7B 模型依然依托于这套 Infra 在真实市场中持续判断,每天写下实盘记录,公开在 trajops.astraculum.com。


    以下为这项研究的作者及机构:


    • Haofei Yu、Yining Zhao、Jiaxuan You(伊利诺伊大学厄巴纳 - 香槟分校);

    • Chishang Yang、Junbo Yan、Senquan Gao(Astraculum)


    © THE END

    转载请联系本公众号获得授权

    投稿或寻求报道:liyazhou@jiqizhixin.com


    这次,Token要直接发给学生,每人30万元
    编辑|张倩


    「我有个个人观点,如果手上没有付费 Token 的同学,就要立即退学」。


    今年开学季,南大副教授蒋炎岩的这句话在社交媒体上迅速刷屏,相关话题还冲上了知乎热榜。



    当然,这句话并不能只看字面,蒋教授只是用一...

    编辑|张倩


    「我有个个人观点,如果手上没有付费 Token 的同学,就要立即退学」。


    今年开学季,南大副教授蒋炎岩的这句话在社交媒体上迅速刷屏,相关话题还冲上了知乎热榜。



    当然,这句话并不能只看字面,蒋教授只是用一种略为夸张的方式给同学们提个醒:Token 已然成为 AI 时代的实验耗材,每个学生都得有,也得会用。


    这边蒋教授刚对着学生喊完话,大洋彼岸,斯坦福大学教授李飞飞就给大学校长敲响了警钟。


    她在转发 OpenAI 最新的研究效率数据时写道,研发世界正在分裂成「Token 充足的研究」和「Token 匮乏的研究」。在最顶尖的 AI 公司和新型研究机构里,研究者的能力正在被大量 AI Token 放大。而大学科研未来怎么办,已经到了值得所有大学校长认真思考的时候。



    两个人喊话的群体不同,但背后其实是同一件事:AI 正在重新定义科研资源


    过去我们说一个实验室资源好,想到的可能是 GPU、服务器、实验设备…… 现在,检索文献、设计实验、找失败原因、探索新思路…… 样样离不开 Token。甚至有人说,Token 就是 AI 时代的笔和纸,应该成为科研生产过程中的一种基础投入。


    这个判断,产业界早已用脚投票。头部 AI 公司内部,研究团队的 Token 供给几乎按需分配;给工程师和研究员发 Token 额度,正在成为科技公司的标准动作。大家心照不宣的共识是:给研究者充足的 Token,就是给他们出成果的可能。只是这个共识,还没覆盖到广泛的高校学生群体。


    不过,变化正在发生。9 月 21 日,腾讯正式启动第二届青云奖学金,每位获奖者的激励中,包含价值 30 万元的 Token 额度。这一次,Token 被直接发到了学生手里。


    腾讯青云奖学金专注于解决同学们实际的科研痛点和问题,助力科研探索,去年已经成功组织过一届,腾讯首席 AI 科学家、青云奖学金主审人姚顺雨还在现场给 15 位脱颖而出的青年人才颁了奖(图为颁奖典礼现场)。


    申报地址:https://join.qq.com/scholarshipapply.html


    30 万元的 Token,对一个学生意味着什么?要算清这笔账,得先知道学生们手里的 Token 现在是怎么花的、又缺到什么程度。为此,我们和几位在读博士生聊了聊。


    没有 Token 的科研,

    正变得越来越难


    在高校实验室里,缺 Token 是一种日常。



    在采访中,我们打听了一下几位博士生的 Token 开销,大家报的数字从几百块到大几千不等。有的人可以通过课题组报销,有的人只能自己承担。而从社交媒体晒出的情况来看,「自己承担」这种情况可能更加普遍。


    但不管谁掏钱,有一点是共同的:都得精打细算。


    于是,一些本该交给 AI 的工作,最后还得由人来「省 Token」:把一个大任务拆成几个小任务,手动优化流程,控制上下文长度;或者先用更保守、更便宜的方法试一遍,再决定要不要调用更强的模型。



    这些操作当然都能接受,但代价是实打实的:时间成本增加了不说,更要紧的是,试错次数被预算锁死了。


    那如果预算突然不再是问题呢?我们也问了他们第二个问题:如果手里真的有一大笔 Token,最想拿它做什么?


    几位博士生的回答方向很一致:可以暂时不把 Token 成本当成科研里的约束条件 —— 更大胆地让模型参与思路搜索,把大量 case trace 一股脑交给模型分析失败原因,或者更频繁地生成代码原型、多试几条实验路线


    说白了,他们缺的不是想法,而是快速验证想法的硬性条件。


    那么,30 万元的 Token 砸下来,对他们来说意味着什么?这个账可以大致算一下。


    30 万元的 Token,什么概念? 


    先算总量。我们让 AI 按照目前主流模型的公开 API 价格算了一笔账:假设按 4:1 的输入 / 输出比例使用,如果全部花在顶级前沿模型上,30 万元可以买到几十亿规模的混合 Token;如果更追求性价比,比如使用 DeepSeek V4.1 Flash 这一档的模型,Token 总量甚至可以达到千亿级。


    但「几十亿」「千亿」依然很抽象。换成科研任务,可能更容易建立直觉。


    Stanford《AI Index 2026》曾统计 AstaBench 上不同科研 Agent 的表现(注:AstaBench 包含 2400 多道科研任务,涉及文献理解、代码执行、数据分析以及端到端科学发现等环节)。在参与测试的 57 个 Agent 中,成绩最高的 Agent 平均完成一道 benchmark problem 的成本约为 3.4 美元,而多数 Agent 的单题成本低于 1 美元。如果只是机械地按照这个成本折算,30 万元 Token 大约对应 1.3 万到 4.5 万道科研 benchmark 问题


    2026 年一项针对 Terminal-Bench 的研究,则展示了另一种极端情况:大多数智能体尝试完成任务的时间不到 20 分钟,但在部分复杂任务中,Agent 会连续运行接近两个小时,期间发起数百次 API 调用,单个任务甚至可能消耗接近 1 亿 Token。也就是说,如果把一次任务做得足够「重」,30 万元 Token 也能跑几十到上千次长链条、深度运行的 Agent 实验


    换算方法不同,数字会有很大差异。但无论从哪个角度算,这都是一位相当「奢侈」的 AI 研究助手。


    落到人身上,这笔账可能更有实感。那几位每月自掏几百到大几千、处处精打细算的博士生,按自己理想中的使用强度估了估:这笔 Token,够他们过上 1~3 年「Token 自由」的日子



    换句话说,30 万元 Token 买到的不只是调用次数,而是读博期间最稀缺的一样东西:试错的自由。


    Token 之外,还有什么? 


    从上面算出的数字来看,30 万元的 Token 已经能够帮同学们解决很大的难题了,但这并不是腾讯青云奖学金的全部。


    考虑到同学们在科研过程中可能面临的其他支出以及普遍存在的经济压力,这届青云奖学金还给每个学生奖励 20 万元现金,而且这笔钱不限用途。据上届同学反馈,他们有的拿这笔钱支付 API 和 Token 调用等科研支出(今年这笔支出也省了);有的拿它负担学术会议差旅。以前跨城市参会得仔细算账,现在从容了不少,还有人顺带捎上了实验室的同门和学弟学妹,让不是一作的同学,也有机会去顶会现场看一看。


    值得注意的是,除了奖励 Token 这个创新,今年的名额也扩大了 —— 去年是 15 位,今年增加到 20 位。而且,面向的人群也从大陆及港澳台扩大到全球 —— 具有中国国籍,计算机科学、人工智能及其交叉领域全球高校就读,毕业时间在 2028 年 1 月及以后的硕博同学,都可以报名


    时间线很简单:9~10 月报名(10 月 25 日报名截止),11~12 月评审,次年 1 月颁奖。


    作为青云奖学金主审人,姚顺雨也透露了他对同学们的一些期望。


    青云希望找到的,是真正具有科研潜力、创新意识和长期成长潜力的年轻人。在姚顺雨看来,真正的科研和创新,往往需要长期面对没有答案的问题 —— 不断尝试、不断失败,在持续的探索中找到那件真正值得做的事。


    所以相比论文和奖项,他更关注一个人有没有足够强的 intrinsic motivation(内在驱动力)。「当你真正对一个问题产生兴趣,愿意持续几年、甚至十几年去思考它、探索它,这种驱动力往往比任何一篇论文、任何一个奖项都更加重要。」


    这也解释了为什么,青云奖学金不止于发钱和 Token。真正有自驱力的年轻人,可以通过评选被识别出来;但要把这种自驱力变成更长期的科研探索动力,光靠个人并不够,还需要一些钱买不到的「外力」。而这种外力,很多时候就来自连接。


    第一届腾讯青云奖学金 Poster 展现场。


    对还在高校里的研究者来说,这类连接其实并不天然存在。很多人平时接触最多的是导师、同门和同领域学者,很难持续知道工业界正在面对什么问题,也不容易和真正做一线技术的人长时间交流。


    去年的青云奖学金就提供了这样的机会。比如在 Poster 交流和闭门讨论里,获奖同学可以直接和腾讯技术专家聊自己的研究,也会遇到来自不同学校、不同方向的同龄研究者。更重要的是,这些连接并没有随着活动结束就消失。


    香港中文大学的邓洋涛提到,获奖后,他和业内老师、同行有了更多往来,也会继续讨论合作的可能,随着交流深入,这样的机会还在增加。


    做计算生物学与统计遗传学的宋立阳也有类似经历。获奖之后,他认识了不少生命科学产业界的专家和朋友,其中一些联系一直延续到现在。对做基础科学的人来说,这类交流的意义也很直接:除了学术同行之外,多了一批来自真实产业环境的反馈来源。


    这些变化很难像 20 万元现金、30 万元 Token 那样直接量化,却可能在更长的时间里发挥作用。科研当然需要资源,但也需要反馈、参照和合作对象。尤其对刚刚建立自己研究方向的年轻人来说,能不能跨出原来的学术圈层,接触到不同问题和不同视角,有时候会影响下一步往哪里走。


    所以青云奖学金想提供的,其实可以理解成两类东西:一类解决眼前的约束,让年轻研究者有更多试错空间;另一类则试图把他们接入一个更大的科研网络,让一次获奖之后,交流还能继续发生。


    这届 AI Native 的年轻人,

    能走多远?


    最近大家可能看到过一个新闻:两名美国高中生 Aayush Bathija 和 Prince Rohatgi,在 UCLA 数学系博士后 Daniel Soskin 的指导下,借助 Claude Opus 5、GPT-5.6 Sol 等 AI 工具,把一个此前已经被菲尔兹奖得主 June Huh 等人研究过的数学问题继续向前推进:他们把关于洛伦兹多项式系数比值的结果,从较特殊的二次情形推广到了更一般的情况。最终,这项工作被写成一篇论文,发布在 arXiv 上。两位高中生均为 UCLA 数学圈(ORMC)成员。



    真正值得注意的,可能不只是「高中生做出了数学研究」。它更像是在提醒我们:当一个年轻人同时拥有足够强的 AI 工具、好的指导者,以及能够持续交流的同行环境时,年龄和知识积累带来的门槛,正在被重新改写


    我们在采访中,也把类似的问题抛给了一位博士生:如果真的给年轻研究者价值 30 万元的 Token,他们会不会因此做出一些跨越式的成果?


    他的回答很直接:「会的。现在没有什么知识是不会的,有了 AI 之后,大部分知识其实都可以学到,科研的很多环节也可以由 AI 来辅助指导完成。」


    当然,AI 工具解决的是能力和效率问题,它并不是全部。有人帮你判断一个问题值不值得追,有同行和你交换思路,有来自不同领域的人提供新的反馈,这些「连接」同样会影响一项研究最后能走多远。


    这也是腾讯青云奖学金「为更值得的探索」在今天更值得关注的一层含义:给资源,也给连接,让真正有好奇心和内在驱动力的人走得更远


    AI Native 的一代研究者,正在拥有前所未有的工具条件。接下来更值得观察的,是当工具、资源和连接都变得更容易获得之后,他们会把这些条件带向哪些过去不敢碰、也碰不到的问题。


    © THE END

    转载请联系本公众号获得授权

    投稿或寻求报道:liyazhou@jiqizhixin.com



    开发者实锤:OpenAI的广告正在跨站收集你行为信息
    编辑|冷猫

    让人担心的事情,还是发生了。


    随着我们越来越习惯把问题交给 AI,聊天记录、工作内容、兴趣偏好,甚至一些原本只属于自己的细节,也在不断进入模型的视野。


    但更坏的是,开发者已经实锤,OpenAI 还可能通...

    编辑|冷猫

    让人担心的事情,还是发生了。


    随着我们越来越习惯把问题交给 AI,聊天记录、工作内容、兴趣偏好,甚至一些原本只属于自己的细节,也在不断进入模型的视野。


    但更坏的是,开发者已经实锤,OpenAI 还可能通过一些不那么显眼的方式,获取你在其他网站上的浏览行为。也就是说,即使你没有在 ChatGPT 里说出口,你在网页上的一些动作,也在成为它了解你的另一条线索。


    这件事一经披露,已经冲上 HackerNews 热榜第三。



    安全研究者 buchodi 近日发布了一份详细的技术调查报告,逆向了 OpenAI 广告平台(内部代号「bazaar」)的完整追踪链路。结论是,OpenAI 在 ChatGPT 中植入了一枚名为 __obi 的 cookie,它能在用户访问安装了 OpenAI 广告像素的第三方网站时,将浏览行为关联回用户的 ChatGPT 账号。



    • 博客链接:https://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/


    一颗 cookie 的旅程


    整个追踪机制分三步完成。


    第一步,当用户打开 ChatGPT 时,客户端生成 16 字节的随机标识符,并通过 POST /backend-api/bazaar/obi/sync-token 接口获取一个 RS256 签名的 JWT。这个 token 把随机标识符和用户账号绑定在一起,有效期 60 秒。


    第二步,客户端将 JWT 跨站发送到 bzr.openai.com/v1/obi/sync,服务器返回一个 cookie:__obi。该 cookie 设置了 SameSite=None; Secure,有效期一年。这意味着它被明确设计为可以在跨站请求中发送。


    第三步,当用户访问安装了 OpenAI 广告像素的商业网站时,浏览器会自动把 __obi 带在请求中发回 OpenAI 服务器。研究者在实际抓包中发现了三类请求都携带了该 cookie,其中最值得注意的一类是:浏览器加载广告像素 SDK 的




















    图片




    实测Livo|我混进AI「西部世界」1小时,被NPC当场拆穿
    编辑|杨文

    AI NPC 开始趁用户下线,继续过自己的日子了。


    以前开放世界能塞几百个角色,城市有昼夜,NPC 按日程吃饭上班睡觉,但这些行为大多提前写在程序里。用户不触发任务,故事便不会发生,用户一离开游戏,N...

    编辑|杨文

    AI NPC 开始趁用户下线,继续过自己的日子了。


    以前开放世界能塞几百个角色,城市有昼夜,NPC 按日程吃饭上班睡觉,但这些行为大多提前写在程序里。用户不触发任务,故事便不会发生,用户一离开游戏,NPC 就集体趴窝。


    大模型出现后,开发者开始尝试让 AI 参与角色决策和世界运行。


    最早跑出来的是 AI 生成故事。2019 年,Latitude 推出 AI Dungeon,让 AI 当起「地下城主」,用户可以输入任何行动,AI 会顺着上下文继续编写情节。


    链接:https://aidungeon.com/


    2023 年,斯坦福大学和谷歌提出 Generative Agents,把 25 个 Agent 放进一座虚拟小镇。它们会记忆、计划和社交,还自行组织了一场情人节派对。


    这项研究让人看到,当角色拥有记忆、目标和社交能力,故事可以从人物互动中自然出现。


    链接:https://arxiv.org/pdf/2304.03442


    2024 年,Unbounded 进一步尝试「无限游戏」。语言模型负责生成玩法、故事和角色互动,视觉模型实时生成新的场景。


    链接:https://arxiv.org/pdf/2410.18975


    同期,Altera 在 Project Sid 中把 1000 多个 Agent 放进《我的世界》,这些 Agent 逐渐形成职业分工、制定或修改规则,甚至传播文化和宗教。


    链接:https://arxiv.org/pdf/2411.00114


    到了 2026 年,Latitude 又推出 Voyage,在生成式叙事之外加入 World Engine,用来追踪人物背景、关系、地点、物品和长期后果。角色记得用户以前干过啥,也会按自身动机改变立场。即使用户下线,世界状态仍能继续演进。


    链接:https://voyage.io/


    不过,一个能够运行的世界,不等于一个好故事。


    Agent 可以聊天、行动,甚至组建社会,但悬念如何铺设,关系怎么产生张力,还得靠内容设计。


    最近,快看新上线了一款 AI 产品 Livo,选择从内容入手,其形式有点类似「AI 酒馆」。


    创作者先搭建世界观、主要人物和关键剧情,再由多个 Agent 维持角色的情绪、记忆、关系和日常行动。用户会获得一个世界内身份,进入一段已经埋下矛盾、秘密和人物命运的故事。


    目前,Livo 已推出四个精品故事世界,题材覆盖校园、都市、谍战和奇幻。



    其中在《蒂利亚之冬》中,故事设定在一列横跨大陆的「和平号」上,用户带着各方争夺的 XK-101 样本登上列车,也由此被卷入多个阵营的较量。


    用户需要判断谁可以相信,也可以隐瞒、试探甚至欺骗角色,已经说过的话会进入记忆,角色的情绪与关系也会发生变化。与此同时,列车上的人物还在按照各自的日程行动,新的事件持续出现。


    当创作者写下的故事骨架遇上会自主行动的 Agent,Livo 能否让一个故事世界真正活起来?


    AI 版「西部世界」来了


    Livo 很容易让人想到美剧《西部世界》。


    剧中的未来乐园被布置成美国西部小镇,里面生活着一群高度拟真的 AI 角色,人们称之为「接待员」。他们有身份、有工作,也有各自的故事。每天,角色按照写好的剧情相遇、冲突和死亡。夜晚来临,工作人员将他们维修并清除记忆。第二天,一切重新开始。



    人类游客可以进入乐园,随意参与和改变剧情。随着旧记忆不断残留,部分角色逐渐意识到自己身处循环。他们开始怀疑眼前的世界,也开始追问自己的选择究竟来自程序,还是来自真实意愿。



    打开 Livo,也能看到类似的产品想象。首页是一片世界星图,每颗星对应一个独立故事,用户选中一个世界,便以特定身份进入其中。



    Livo 融合了互动小说、剧情游戏、AI 角色扮演和世界模拟,核心依然是故事。它把叙事从一条预先完成的剧情,扩展到人物、关系、记忆和持续变化的世界状态。


    就以《蒂利亚之冬》为例。


    开场动画很快交代了战争背景和身份设定,用户从一开始就有明确的来历、任务和秘密,但谁值得信任,其他人又掌握了多少信息,都需要在故事中逐渐判断。



    随后出现的是一张俯视角列车地图,角色头像分布在阅览室、仓库、二等车厢等地点,各自按照日程行动。


    地图下方持续更新世界动态,记录新角色登场、人物行动和正在发生的事件,即使没有用户干预,这个世界也在自运转。



    我们先进入了罗兰的剧情。这段相遇属于「注定的命运」,关键情节已经由创作者提前设计。开场有明确的时间、地点和矛盾,罗兰会描述自己的动作,也会借一个关于自由与秘密的故事试探我们。


    系统提供了剧情选项,我们也可以直接输入,可以顺着他的问题回答,也可以追问、回避、隐瞒,甚至故意给出错误信息。每次选择之后,剧情都会继续生成,罗兰的动作、语气和态度也会变化。


    这种体验更接近互动小说,场景描写、人物动作和心理变化一起出现,用户既在阅读故事,也在扮演故事中的角色。



    界面下方会显示罗兰当前的情绪。点开 Deep Feeling,还能看到他如何理解我们刚刚说过的话,系统用权衡与玩味、亲密与疏离、爱怜与杀伐等维度呈现他的状态。


    具体感受也会被记录,我们记得他的名字,他产生「雀跃」;我们看穿故事里的秘密,他又感到「愉悦」。这些反馈让我们知道,同一句话进入角色心中后,留下了怎样的影响。



    结束对话后,这段经历会进入「我们的命运」。其中,「注定的命运」承载主线和关键事件;「潜在的命运」结合当前关系与过往选择生成新的支线;「已发生的命运」保存我们亲历过的情节。长按界面中的蝴蝶,还能寻找一段新的潜在命运。



    这让故事拥有两种推进方式,我们可以跟随创作者设置的主线,也可以根据人物状态和当前关系,进入临时生成的情境。


    角色也会在互动中发生变化。与罗兰交流后,我们打开了他的「灵魂图谱」,清醒理智、擅于伪装、野心勃勃、冷血残酷等特征组成了他的性格轮廓。部分信息最初处于隐藏状态,随着交流深入才会逐渐显现。



    「灵魂演化」会记录变化发生的原因。一次谈话可能让他的戒备下降,也可能暴露出更强的试探欲。我们能够看到角色此刻的状态,也能追溯他为什么产生变化。



    「照见我」把视角转向我们。页面会记录角色对我们的理解、我们对角色的了解,以及我们对他们造成的影响。我们在观察角色,角色也在逐渐认识我们,说过的话会拼出一个属于我们的形象,并影响下一次相遇。



    一轮体验下来,Livo 更接近一款以人物关系和剧情选择为驱动力的 AI 互动叙事产品。它最特别的地方在于连续性,地图、对话、人物情绪和世界事件彼此关联,用户退出聊天,故事也没有随之暂停。


    AI 生成的开放性,能和专业叙事结合吗?


    在一两轮对话里,角色保持人设并不难,但互动被拉长后,它还能否一直像自己,才是真正的考验。


    角色完全不变,长期互动很快会失去新鲜感;变化缺少依据,又会出现人格漂移。一个谨慎多疑的人,不能因为几句示好便突然交付信任。


    Livo 为此给角色设置了两套状态。六层人格档案保存相对稳定的部分,包括自我意识、底层需求、信念、思维方式、立场和情绪倾向;实时变化的情感状态,则记录角色在具体情境中的感受,新的体验会影响当下判断,重要经历还会沉淀进长期关系。


    故事的开放性则带来了另一项挑战。


    传统互动叙事依靠分支树,每个选项和结果都由创作者提前写好,内容越复杂,制作成本越高,完全交给 AI 生成,又容易失去节奏,甚至偏离人物动机和主线目标。


    Livo 将两部分拆开处理。


    创作者负责决定世界规则、核心冲突和关键转折,主线划定故事方向,人工撰写的「红色情境」承担重要场面;AI 生成的「黑色情境」负责连接这些节点,并根据人物状态补充个性化支线。


    前文出现的三类「命运」,就是这套分工在产品中的呈现。创作者决定哪些事情必须发生,AI 结合当前关系判断它们如何发生,用户已经做出的选择会成为新的条件,继续影响后面的情节。


    结构化完成后,不同 Agent 开始分工


    Soul Agent 负责角色的判断和行动,World Agent 调度日程、事件、环境和关系,Deep Feeling 处理从感知到表达的情绪链路,执笔者 Agent 则在创作者划定的范围内补充情境。


    这些 Agent 还需要共享记忆和因果关系。Livo 会根据情感重要程度保存信息,普通寒暄可能很快淡化,涉及秘密、承诺或背叛的交流会获得更高权重。不同故事世界之间的记忆彼此隔离,角色不会知道另一个世界发生过什么。长程因果系统连接关键结果、阶段事件和人物选择,避免故事运行时间变长后出现明显矛盾。


    因此,Livo 的技术难点不只在模型能力,更关键的工作,是把文学语言翻译成心理结构,再把心理结构变成能够持续运行的数据。


    这正是快看发挥内容积累的地方。过去的创作者资源和 IP 经验,可以提供人物、冲突和世界观,技术团队再将这些设定拆成规则,让角色在不同情境下作出相对一致的判断。


    好的故事提供悬念和情感张力,Agent 提供变化和连续性,两部分缺少任何一边,体验都很难成立。


    AI 时代会怎样重新讲故事?


    过去两年,AI 与内容产业的结合大多围绕提高产能。生成图片、视频和剧本,可以让内容做得更快、更便宜,但 AI 能否改变故事本身的运行方式?


    在 Livo 的设想中,AI 进入故事内部,参与人物和世界的长期运行。


    传统作品通常在发布前完成,情节、人物弧光和结局已经确定。进入这类 AI 原生产品后,发布更接近一次开场,创作者提供世界规则、角色人格和关键剧情,用户的参与会不断加入新的条件。


    创作者的工作,除了写出有吸引力的人物和冲突,他们还要设计角色的判断方式、行动边界和变化条件。作品质量也增加了新的衡量维度,人物能否长期保持一致,生成内容能否维持因果,用户的选择能否留下真实影响,都将决定体验能走多远。


    从实际体验上讲,现阶段的 livo 仍是一款早期探索性的产品。用 AI 打造活着的世界,本就是一个复杂工程,面临着许多需要攻克的难题。


    但 AI 时代会怎样讲故事,已经成为所有文娱从业者绕不开的课题。快看率先给出了他们的解法,这或许是 livo 推出最大的行业意义。


    © THE END

    转载请联系本公众号获得授权

    投稿或寻求报道:liyazhou@jiqizhixin.com