从 Hidden Decoding 看微信为什么需要自己的大模型
最近看到WeChat AI Team发的一篇文章:Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models,并发现了他们团队的博客:https://welm.weixin.qq.com,微信团队不止在做垂类的应用,而是真的花精力去做了ai基建。那比起来如日中天的混元团队,腾讯何必培养两只这样的团队呢。
1.Hidden Decoding到底做了什么?
在不增加 Transformer 主体参数的前提下,通过复制多份 Vocab Embedding 将序列长度扩展 n 倍,使每个 token 在单次前向传播中获得 n 倍的有效计算量,并将其推进到了前沿规模,得到了WeLM-HD4-617B(n=4)。
- 前沿规模的训练扩展
- Stream-Factorized Attention让扩展在大模型上可训
2.微信也有独立的前沿模型研究能力
微信在腾讯内部的地位超然是总所周知的,但能另开一条线做模型甚至更基础的研究是让我没想到的。特别是在混元刚由姚顺雨统筹起来的如今。
3.腾讯已有混元,微信为什么还要自己的模型?-超级应用与集团底座的不同目标函数
- 3.1 微信搜索
- 3.2 公众号和视频号推荐
- 3.2 真正的为什么微信不用混元,因为前两个原因似乎都能让混元去做。
4.腾讯为 AI 付出了多高的代价?
5.WeLM 与混元是竞争、分工还是先赛后合
判断是不是“昂贵重复建设”的标准
- 先竞争后合流
- 双线本身不一定低效。真正的风险不是内部存在竞争,而是竞争长期不能收敛,也无法转化为产品差异或集团共享能力。
6.腾讯 AI 真正竞争的不是榜单,而是产品定义权
对投资者而言,关键不在于WeLM是否在几项榜单中领先混元,而在于腾讯能否把模型能力转化为搜索增长、内容消费、广告效率、小程序交易和云收入,并最终覆盖正在快速上升的AI投入。
Hidden Decoding让我看到的,不只是腾讯多了一种Scaling方法,而是微信正在为Agent时代争取一次重新定义入口的机会。腾讯为这次机会付出的代价已经足够高,接下来需要证明的,不是模型还能多考几分,而是它能否真正改变用户行为和公司的利润结构。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Lux's Blog!