最近看到WeChat AI Team发的一篇文章:Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models,并发现了他们团队的博客:https://welm.weixin.qq.com,微信团队不止在做垂类的应用,而是真的花精力去做了ai基建。腾讯刚刚进一步整合混元的大模型、多模态和 Infra 能力,微信 AI 产品公开口径上也会受益于混元。但与此同时,微信团队却在训练数百亿到数千亿参数的 MoE 模型,并研究一种新的 Scaling 路线。腾讯似乎没有必要在越来越高的AI投入的压力下,做出这种看似重叠的安排。

Hidden Decoding到底做了什么?

在不增加 Transformer 主体参数的前提下,通过复制多份 Vocab Embedding 将序列长度扩展 n 倍,使每个 token 在单次前向传播中获得 n 倍的有效计算量,并将其推进到了前沿规模,得到了WeLM-HD4-617B(n=4)。

  • 前沿规模的训练扩展
  • Stream-Factorized Attention让扩展在大模型上可训

微信也有独立的前沿模型研究能力

微信在腾讯内部的地位超然是总所周知的,但能另开一条线做模型甚至更基础的研究是让我没想到的。特别是在混元刚由姚顺雨统筹起来的如今。但这不意味着WeLM已经在微信产品上大规模使用或者腾讯正式建立了两套平行基础模型体系。腾讯的公开口径反而显示,微信AI未来会受益于混元能力。

腾讯已有混元,微信为什么还要自己的模型?-超级应用与集团底座的不同目标函数

  • 1 微信搜索
  • 2 公众号和视频号推荐
  • 2 真正的为什么微信不用混元,因为前两个原因似乎都能让混元去做。

腾讯为 AI 付出了多高的代价?

WeLM 与混元是竞争、分工还是先赛后合

判断是不是“昂贵重复建设”的标准

  • 先竞争后合流
  • 双线本身不一定低效。真正的风险不是内部存在竞争,而是竞争长期不能收敛,也无法转化为产品差异或集团共享能力。

腾讯 AI 真正竞争的不是榜单,而是产品定义权

对投资者而言,关键不在于WeLM是否在几项榜单中领先混元,而在于腾讯能否把模型能力转化为搜索增长、内容消费、广告效率、小程序交易和云收入,并最终覆盖正在快速上升的AI投入。

Hidden Decoding让我看到的,不只是腾讯多了一种Scaling方法,而是微信正在为Agent时代争取一次重新定义入口的机会。腾讯为这次机会付出的代价已经足够高,接下来需要证明的,不是模型还能多考几分,而是它能否真正改变用户行为和公司的利润结构。