最近看到WeChat AI Team发的一篇文章:Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models,并发现了他们团队的博客:https://welm.weixin.qq.com,微信团队不止在做垂类的应用,而是真的花精力去做了ai基建。那比起来如日中天的混元团队,腾讯何必培养两只这样的团队呢。

1.Hidden Decoding到底做了什么?

在不增加 Transformer 主体参数的前提下,通过复制多份 Vocab Embedding 将序列长度扩展 n 倍,使每个 token 在单次前向传播中获得 n 倍的有效计算量,并将其推进到了前沿规模,得到了WeLM-HD4-617B(n=4)。

  • 前沿规模的训练扩展
  • Stream-Factorized Attention让扩展在大模型上可训

2.微信也有独立的前沿模型研究能力

微信在腾讯内部的地位超然是总所周知的,但能另开一条线做模型甚至更基础的研究是让我没想到的。特别是在混元刚由姚顺雨统筹起来的如今。

3.腾讯已有混元,微信为什么还要自己的模型?-超级应用与集团底座的不同目标函数

  • 3.1 微信搜索
  • 3.2 公众号和视频号推荐
  • 3.2 真正的为什么微信不用混元,因为前两个原因似乎都能让混元去做。

4.腾讯为 AI 付出了多高的代价?

5.WeLM 与混元是竞争、分工还是先赛后合

判断是不是“昂贵重复建设”的标准

  • 先竞争后合流
  • 双线本身不一定低效。真正的风险不是内部存在竞争,而是竞争长期不能收敛,也无法转化为产品差异或集团共享能力。

6.腾讯 AI 真正竞争的不是榜单,而是产品定义权

对投资者而言,关键不在于WeLM是否在几项榜单中领先混元,而在于腾讯能否把模型能力转化为搜索增长、内容消费、广告效率、小程序交易和云收入,并最终覆盖正在快速上升的AI投入。

Hidden Decoding让我看到的,不只是腾讯多了一种Scaling方法,而是微信正在为Agent时代争取一次重新定义入口的机会。腾讯为这次机会付出的代价已经足够高,接下来需要证明的,不是模型还能多考几分,而是它能否真正改变用户行为和公司的利润结构。