载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

匿名“牛来”模型被扒智谱出身 Cursor疑云

· · 阅读 5 分钟

一款来路不明的“牛来”大模型,近日被技术社区从头到脚扒了个底朝天。Tokenizer、视频编码、API报错信息……多个技术细节像一串DNA项链,把它的“血缘”指向了智谱AI的GLM系列。更耐人寻味的是,这场“认亲”风波还把编程工具Cursor也卷了进来——有人怀疑,后者曾悄悄拿开源GLM训练自家模型。

事件背景:神秘的“牛来”模型

事情得从几周前说起。一个自称“牛来”的团队匿名发布了一款大模型,并附上若干基准测试分数。这个模型在多模态理解、代码生成等任务上表现格外亮眼,甚至在某些指标上压过了几个主流开源模型。但奇怪的是,团队没有公开任何技术报告,也拒绝透露训练数据、模型架构等基础信息。对社区而言,这像是一个“没有出生证明的天才少年”。

质疑随之而来:一个无名团队凭什么做出如此强的模型?有人开始对比它与其他公开模型的输出特征,试图从“指纹”里揪出真实身份。而这一查,还真查出了不少东西。

社区扒皮三部曲

Tokenizer指纹

Tokenzier是语言模型处理文本的第一道工序,不同模型往往有不同的分词方式。社区研究者将“牛来”模型的Tokenizer输出与多款主流模型逐一比对,发现它的词表切分方式和智谱GLM系列高度一致——包括某些罕见字符切分、数字处理规则,以及几个特殊的token ID。如果只是小范围相似,可以说是巧合;但连那些“只有智谱才有的怪癖”都一一对应,就很难用巧合解释了。

视频编码探秘

更让人意外的是视频编码。多模态模型在处理视频输入时,通常会对帧序列做某种时间-空间编码。检测者发现,“牛来”模型对视频的编码行为与智谱的视频理解模型如出一辙:帧采样间隔、时序位置编码的映射逻辑,甚至对某些特定分辨率下的padding处理方式,都存在明显的同构特征。这类底层实现极少会被文档提及,除非训练时直接借用了原模型,否则很难出现如此高的相似度。

API报错泄露

最“实锤”的一个线索来自API报错。有开发者把“牛来”模型的在线接口与智谱官方API进行“红队测试”,故意构造非法参数、超长上下文、畸形视频输入,结果发现两者返回的报错信息几乎逐字相同——包括错误码编号、错误消息模板,乃至个别拼写错误。API报错文本虽然不是模型权重,但往往能暴露出后端服务的代码路径。如果“牛来”不是基于智谱的底层服务二次开发,这几乎是不可能的。

联系到Cursor

就在“牛来”的出身议论纷纷时,另一条线索被补充进来。有人在技术论坛发帖称,使用Cursor(一款颇受欢迎的AI编程工具)时,其底层模型在某些特定代码场景下的补全风格,与“牛来”模型也有几分神似。由此推测,Cursor可能利用了开源的GLM版本进行微调,再包装成自己的私有模型。当然,目前还没有公开证据直接证明这一猜测,但它让整个事件变得更加微妙:如果说匿名“牛来”是不想让人知道底牌,那么Cursor作为商业产品,是否也悄悄选择了“借力”?

行业意义与影响

这一事件之所以值得关注,并不在于“谁抄了谁”,而在于它揭开了大模型行业里一个日渐普遍的潜规则:重新包装开源模型,正在成为一条低成本捷径。 市面上宣称“自研”的模型,有些可能只是在开源底座上做了微调,甚至直接使用了别人的服务。而如何识别这种“换皮”,则催生了新的技术方向——通过Tokenizer指纹、编码器行为、报错信息等细粒度特征进行模型溯源。

同时,这也对开源协议提出了考验。GLM系列虽然开源,但不同版本的授权条件并不完全相同。如果商业产品直接调用或修改了模型,却没有遵守相应的许可证条款,就可能引发知识产权纠纷。反过来,对于真正想要开源自己模型的研究团队来说,这种“被套壳”的现象也会打击他们继续开放共享的信心。

模型可以匿名发布,但技术细节会留下痕迹。在深度学习领域,每一项设计选择都是由成千上万个参数和代码路径共同决定的,它构成了模型隐形的身份标识。未来,随着模型溯源技术的成熟,那些“不愿透露姓名”的模型,恐怕会发现自己的底牌越来越难藏住。