W

在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab

Business Management
Share
在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab

文|王欣逸
编辑|张雨忻
见到Mind Lab创始人陈锴杰,是在北京的晚上9点半,他已经见了一天的投资人。
陈锴杰是一位连续创业者,从杜克大学休学,做过AI互动故事平台MidReal,也推出了Personal Agent应用Macaron(马卡龙),上线当天就登顶了Product Hunt日榜;2025年10月,Mind Lab成立,团队约30余人,Mind Lab创始人Andrew Chen曾和姚顺雨共同发表FireAct论文,团队主要来自xAI、DeepMind、DeepSeek、字节跳动Seed、MIT和清华大学等企业与高校。他们以Neo Lab的形象再度出现在大众的视野里。
他们所押注的方向,与图灵奖得主、强化学习之父Richard Sutton和OpenAI前CTO Mira Murati所强调的持续学习方向,高度一致。
几天前,WAIC 2026首日主论坛上,Sutton发表演讲,强调了下一代AI的核心路线是经验驱动,而静态标注数据模式已触达天花板。DeepSeek近期也把持续学习带进了更多人的视野之中,声称 Agent之后需要的解决的问题是持续学习,这也是下一代模型必须具备的能力。
可见,后训练与持续学习,越来越成为下一阶段评判模型能力的关键点。
Mind Lab在上个月发布了Macaron-V1-Preview模型,此后业务迅速被推着往前走:商业化刚开始跑2周,ARR就达到了1000万美金。
Macaron-V1-Preview的构成是:在GLM-5.1上,挂载了5个参数约1B的LoRA专家模块。尽管只是一个预览版的模型,Macaron-V1-Preview在多个Benchmark上的表现也很亮眼,不仅性能反超基座模型GLM-5.1外,还领先GPT 5.4、Claude Opus 4.6等一众模型。而超越基座的能力,就来自于挂载其上的LoRA。
而真正让他们备受关注的,是用MoL(Mixture-of-LoRA)的方式做后训练的路径。在模型执行不同任务时,系统可以根据任务类型,动态切换到最适合的专家模块;在用户长时间的使用中,沉淀下来的数据也能积累出一个专属LoRA,能随着模型的不断调用而持续更新。
Preview版本率先跑通了技术路径、做好了市场验证。紧接着,7月21日,Mind Lab发布并开源了Macaron-V1的正式版本。从官方发布的benchmark来看,Macaron-V1在12项基准测试中拿下了6个SOTA,其余成绩和前沿模型也比较接近。
这一版本有两个模型:旗舰版Venti,是一个基于GLM-5.2做后训练、总参数748B的模型,其中744B来自冻结的GLM-5.2基座,4B来自于Mind Lab自己训练的4组各约1B的LoRA,分别负责Chat、Agent、Coding和生成UI界面四类能力;另一个是面向本地部署的轻量版Tall,是基于Qwen3.6做后训练、总参数50B的模型。两个版本都原生支持200万token上下文。
这也意味着, 仅仅改变4B参数,这支团队让GLM-5.2实现了超越自身的能力。
对Mind Lab来说,创业是无数次保持主线与推翻重做的过程。剥去外部的各种喧嚣,在团队内部,一条更为深远的技术路线在不断进化当中——持续学习。
与此同时,一线资本也纷纷押注。 成立以来,Mind Lab母公司Mindverse(心洲科技)累计获得6000万美元融资。 2026年年初,完成由美团战投领投的近5000万美元A轮融资,元禾璞华、韶音科技、变量资本及老股东追加跟投。历史股东包括蚂蚁集团、红杉中国、源一、真格、高榕等。
经验的智能:让模型越来越懂你
最初的出发点,可以追溯到2023年Mind Lab联合创始人Andrew和姚顺雨合作的一篇FireAct论文。那时他们认为,想要提升Agent的任务表现,与其做提示词工程,不如把相关的数据直接训进模型里。
这是他们押注持续学习和后训练的起点,当时,这还不算一个广受关注的技术路线。“当我们开始做持续学习的时候,我们都不知道它叫持续学习。”陈锴杰说。
已有技术存在的问题是,一个通用大模型难以做好对所有场景的适配,在模型训练结束后,其参数往往是固定的,不会因为具体的场景而改变模型的参数,从头训模型的成本又非常高。
想要让大参数模型在不同垂直场景中执行任务,用一个复杂的Harness当然能做好对场景的适配,但是与此同时的必然结果是,它会消耗很多Token,速度也会很慢,这显然无法从根本上解决问题。
在香农信息论的框架下,强化学习范式中,用表征模型学到的参数量的需求变小,这也意味着,模型参数足够大、足够稀疏的条件下,在同一个垂直领域做强化学习,LoRA的效果是可以达到全参训练的效果的。
所以,无需全参数重训,也能做好对具体场景的适配。
他们率先交出的成果是做到了万亿参数的强化学习。 2025年12月,Mind Lab在Kimi K2(一个万亿参数MoE模型)上做到了端到端LoRA强化学习训练,仅用64张H800,实现了接近全参数训练的效果,GPU消耗只有传统全参数RL的10%左右。
当时,一些大厂和创业公司如字节、阿里、DeepSeek、Kimi等也具备万亿参数强化学习的能力,不过,在国内能在万亿参数上跑通LoRA-RL的团队只有Mind Lab一家,而海外唯一能做到的团队是OpenAI前CTO Mira Murati创立的Thinking Machines Lab。
要实现万亿参数强化学习的难点在于,强化学习对基础设施的精度要求很高,如果训练和推理的精度不一致,可能会带来偏差漂移,导致最终的结果没有办法收敛。 Mind Lab的解法是设计了一套混合协同并行引擎,整合了张量并行、流水线并行、专家并行和序列并行,让LoRA能在MoE架构上稳定运行。他们还解决了训练与推理不匹配问题,引入了截断重要性采样来修正分布差异。
这一成果的交出,为Mind Lab打响了漂亮的一仗。不过,在陈锴杰看来,团队真正的技术护城河是基础设施。
一年之前,后训练的数据量大概是预训练数据量的十分之一,但如今,很多模型里后训练数据量比预训练的数据量还要大。要做好后训练的基础设施,比预训练更难。
因此,今年1月,他们推出了一个关于LoRA训推的基础设施平台——MinT,它能面向客户提供大模型后训练全流程解决方案。客户可以在这一平台上获取算力支持,也能训练自己的LoRA。MinT能够管理上百万个LoRA模型,在训练、评估、部署和回滚过程中只传输极为轻量的LoRA Adapter,实时加载速度提升了近十倍。
随后,他们更多的把精力放在了模型自进化与持续学习的路线上,并在LoRA的基础上,继续探索MoL(Mixture of Lora,LoRA协作)的可能性。
持续学习,正在从少数人的探索逐渐演变成行业共识。 两周前,强化学习之父Sutton亲自下场创业,创立新公司Oak Lab,致力于建立一个能从自身经验中持续学习、实时进化的智能体。智谱创始人唐杰在近日的内部信中也提到,下一步要攻克的关键技术包括记忆、持续学习和自我评判。国内外头部团队相继入局,这条赛道的加速正肉眼可见地提升。
在陈锴杰看来,现阶段,持续学习有四种解决方案:
第一种是,聊天的上下文,模型在对话窗口内反复理解用户意图;
第二种是,External Memory,用RAG做记忆外挂。随着要记的东西越来越多,数据库也以非常快的速度膨胀,模型的解决问题能力直接与数据库检索能力挂钩;
第三种是,Harness以及Loop Engineering,问题在于,随着Harness复杂程度的上升,它可能会消耗很多Token,速度也会变得很慢;
第四种是,直接改模型的参数,以适配应用场景,从底层就把它变成一个垂直的模型,从根本上去改变模型的表现。
LoRA属于第四种解决方案。“明确某个场景需要额外的学习后,我们才会启用LoRA模式。”陈锴杰告诉我们。
通用大模型无法解决具体场景里100%的问题,想要做到完全适配,就需要在任何场景中对模型做垂直的训练。有时候,不同模型之间99%的参数都是可以共享的,但那1%的部分就决定了他们的差异。
基于这个理解,陈锴杰认为要把模型放进不同的经验之中,让它不断去成长。
Mind Lab将这套思路总结为“经验智能”(Experiential Intelligence):模型可以从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题,更难的问题又带来更丰富的经验,智能由此成为了一个持续生长的过程。不仅如此,这个过程是自动化的,模型需要不断的自进化、自迭代,这样才能做到真正的“持续学习”。这一方向,也与Sutton的“经验驱动”路线不谋而合。
Macaron-V1-Preview和Macaron-V1的相继推出与市场化验证,也让大众看到了经验智能的可能性。
协作的智能:用Mixture of LoRA突破智能的上限
在陈锴杰看来,后训练正在逐渐成为一个赛道。目前,行业内出现了一批专门承接预训练完成后的模型、聚焦后训练方向的创业公司。其中,有不少玩家聚焦在小模型场景,做垂直细分领域的后训练、数据处理相关工作。
在LoRA路线上,Mind Lab并非孤军奋战,陈锴杰告诉我们,他们的技术和Thinking Machines Lab是高度一致的,尤其是在选取LoRA训练的路线上。TML在其论文《LoRA Without Regret》中也独立印证了同一结论: 在足够大的MoE模型上用LoRA做强化学习,性能没有任何损失。
不过,强化学习还需要和模型架构耦合。由于架构的不同,Thinking Machine s Lab和Mind Lab能训练的模型有一定的差异。比如GLM-5系列引入了MTP(多Token预测)和DSA(动态稀疏注意力)等高效推理架构,这些设计对训练框架有特定的适配要求,而Thinking Machines Lab的整个技术栈是为DeepSeek-V3标准架构打造的,因此难以兼容GLM。
Mind Lab则率先完成了GLM-5.1和GLM-5.2上的强化学习后训练。这是全球第一个在GLM-5.1上完成强化学习后训练的外部团队成果。
值得一提的是,无论是Macaron-V1-Preview还是Macaron-V1,Mind Lab都设置了多个LoRA,这些LoRA可以单独使用,也可以展开协作。这一设置背后,是因为他们发现,一个LoRA没有办法把模型的所有能力全面提升,但在一个模型上用多个LoRA,整体能力就会大幅提升。
Mind Lab曾用200份不同的数据分别训练了200个LoRA,让这些LoRA挂在某一模型上协作完成任务,他们有两点发现:
一是,参与协作的LoRA数量提升后,模型任务的表现也会呈log线性增长的关系,越多LoRA协作,效果越好。
二是,相比用这200份数据训出的一个LoRA,让200个LoRA共同协作后的模型表现会更好,较前者能提升约25%的能力。
这也让Mind Lab看到了模型协作能突破的智能上限,单一的LoRA是不够的,MoL(Mixture of LoRA)可能是更为有效的办法。“这也是一个需要持续探索的话题,比如多少数量的LoRA协作是更有意义的,LoRA与LoRA之间的协作如何分工,什么时候需要协作以及什么时候一个LoRA就足够了。”
国内后训练的竞争也在加速。赛道内的玩家各有所长,但能在万亿参数规模上同时跑通LoRA-RL、构建百万级LoRA管理基础设施、并将持续学习落地到商业场景的团队,仍然不多。
从后训练,到持续学习
Mind Lab目前的业务被划分成了三个部分:持续做Infra系统和后训练的前沿研究;做C端产品Macaron(马卡龙)的更新和迭代;以及在B端做好客户服务,一方面是为微软云、华为云等企业部署更便宜的训练Infra,另一方面是提供MinT及持续学习的LoRA模型。
其中,Macaron App的定位是一个生活场景的个人Agent,用户可以通过自然语言生成专属小应用,基于长记忆与日常对话,提供日常生活辅助以及情感陪伴等功能作为C端场景的应用,Macaron积累的用户交互数据对模型训练同样具有重要价值,这些真实使用场景中的行为表现,能帮助团队更深入地理解用户与模型的互动方式。
值得一提的是,B端客户中,有不少是智能硬件厂商,而智能硬件恰好是持续学习模型落地的天然场景,不同用户使用中积累的数据几乎都不相同,个人化、差异化的数据,对模型垂直领域的个性化持续学习很有价值。
在基本的模型调用服务上,Mind Lab未来还将为客户提供“持续学习”的选项,勾选了这个选项后,在模型使用中的表现好的各种数据,会沉淀到一个专属的LoRA中,持续训练出一个更符合客户使用场景、输出正确率更高的模型。LoRA在持续学习中,几乎能实现每天更新一个新版本、更适配用户需求和场景的LoRA。
不过,对Mind Lab来说,商业化只是现阶段对技术落地的验证,并不是他们急着要做的事情。锴杰告诉我,目前Mind Lab已经达到1000万美金ARR,还有很大的增长空间,“但我们也不想把所有的算力都拿去跑订单,重点还得把research做好。”
对于Mind Lab而言,Research的底色是始终保持不变的。陈锴杰告诉我们,团队里目前做研究的成员约30多人,包括做基础Infra和前沿研究。
“推动LoRA的进步,是我们想要扮演的角色,我们要解决模型预训练完的最后几公里的事情。” LoRA是一个技术方向,它有很多变体,比如如何做线性注意力,如何拓展模型的上下文,如何做好LoRA等协作,这些都还亟待探索。
图片来源|企业供图
欢迎关注~
欢迎交流~

在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab

在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab

在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab


来源:36氪

DisclaimerPlease read market information rationally and stay aware of investment risks. All content on this site is for informational purposes only and does not constitute investment advice.

Related Reading

Hardware wallet sales in Russia more than double as new crypto rules near

Wildberries’ average price for hardware wallets fell 13% to 7,900 rubles, and M.Video broadened its range of products, though neither retailer identified the…

US spot Bitcoin ETFs post best week since April with $1B inflows

The spot Bitcoin exchangetraded funds registered their thirdstrongest showing since October as institutional demand showed signs of renewed momentum.…

Brazil's central bank orders exchanges to delay large crypto transfers abroad

The rule applies to transfers above $10,000 and smaller transactions flagged as risky by exchanges. Source:CoinDesk

US Senate to vote on advancing CLARITY Act in September after Thune files cloture

The procedural move puts crypto market structure legislation back on track as lawmakers continue negotiations over ethics and stablecoin provisions.…

Sourcehttps://36kr.com/p/3916202023660929