文章ID:2844

杀生

千问还是不够自信_我的网站

魔女的条件

一 |     这几天国模简直像在开大会。先是k3搞了个大新闻,然后昨天qwen3.8又发布了,都是2T以上的大参数模型。    

根据美国疾病控制与预防中心(CDC)近期更新的数据,如今在美传播的主要变体是以KP.2为首的“FLiRT”一族:KP.2的占比已经达到25%。
值得注意的是,新冠病毒的新变种KP.2正在加拿大、英国等多个国家迅速传播。

二 | 据说今天deepseek v4也要发布,本来想等v4发布一起聊,可惜没等到。今年5月初,世界卫生组织已将KP.2亚变种列为监测中变异株。世界卫生组织表示,将继续密切监测病毒的演变。         不过光是目前千问这一波操作,就已经有不少值得琢磨的门道。

美国疾控中心最新数据显示,目前,KP.2占美国感染病例的四分之一以上。截至5月11日的两周内,KP.2估计占美国病例的28.2%,高于4月中旬的约6%和3月中旬的仅1%。

三 |          时机上,Kimi K3刚刚发布,而且表现非常亮眼;DeepSeek v4即将发布,水平未知,但按照梁圣的一般水准肯定值得期待。

据悉,KP.2是JN.1变种的后代,有时被称为“FLiRT”变体,因其在刺突蛋白中的突变位置而得名。         夹在这两家之间,qwen3.8的局面就有点尴尬,要是模型能力打不过k3,性价比搞不过v4,对外口径上不好宣传。包括KP.1.1在内的其他FLiRT变种也在美国流行,但还没有KP.2那么普遍。         另外值得关注的地方是,阿里这次发布时就明确将开源qwen3.8。“FLiRT”最初是在美国下水道系统中发现的,但确切来源尚不清楚。
这意味着,新冠病毒仍在变异。(公众号推文作者都变成了“蓄势待发要开源的”千问大模型)          林俊旸当初离职,有个因素就是集团对开源的态度有调整,开始更多考量开源的成本收益。CDC发言人发出警告称,病毒通过突变不断发生变化,有时这些突变会导致病毒产生新的变种。一些变化和突变使病毒更容易传播或使其对治疗或疫苗产生抵抗力。随着病毒的传播,它可能会发生变化并且变得更难以阻止。
当前,CDC正在监测KP.2和KP.1.1引起的感染。早期数据表明,它们产生与JN.1相似的症状,通常出现在感染后2至14天,这些症状主要影响上呼吸道,包括喉咙痛、鼻塞、流鼻涕、咳嗽、发烧、头痛以及味觉和嗅觉丧失。         阿里前段时间也的确有这种迹象,从“积极拥抱开源”转向“有条件拥抱开源”和“选择性开源”。
美国传染病专家罗伯特·墨菲博士表示,虽然症状和严重程度似乎与之前的新冠病毒毒株大致相同,但新变种似乎更具传染性。墨菲敦促公众了解新冠疫苗注射的最新情况,特别是那些因该病毒而出现严重并发症的风险较高的人。

四 | qwen3.8 max的开源承诺,表明阿里重新回归了过去三年的主路线。虽然大多数人对疫苗接种或以前感染过的新冠病毒有一定的免疫力,但墨菲指出,“对于新冠病毒感染(COVID-19),免疫力会随着时间的推移而减弱。                   翻译跟措辞的艺术          比较有意思的是,千问中英文官方账号发布的介绍有个很细微的区别。英文版直接说的 "second only to Fable 5",仅次于 Fable 5。

五 | ”

到目前为止,这一变体尚未被证明会导致更严重的疾病,疫苗也仍然有效。
英国华威大学病毒学家、分子肿瘤学教授Lawrence Young表示,“我们担心这个KP.2会在夏天引起一波感染。         但是中文版居然加了个“可能”,原话是“可能是除了Fable 5外最强大的模型”。这个让人不太理解,难道官方其实也不是非常确定qwen3.8的水平,还是说担心国内放卫星容易被冲?          千问还是不够自信。

六 |          国内几家搞大模型的,阿里算是比较喜欢放卫星的。这跟管理层风格有关系,每次开财报会阿里也是最乐观的。早期证据表明,KP.2似乎比以前的亚株更具传染性,但现在判断它是否更危险还为时过早。我们应该监测这个亚谱系的传播,但鉴于现在没有很多测试,这很困难。”

值得注意的是,新冠病毒的新变体FLiRT正在加拿大、英国等国家迅速传播。
当地时间5月9日,据Global News报道,KP.2迅速在加拿大占据主导地位,截至4月28日,全国数据显示,KP.2占加拿大所有COVID-19病例的26.6%,超过其他JN.1亚变种。         最典型的就是之前快乐马,当时出来跑分屠榜一骑绝尘,但等大伙冷静下来用过后发现模型表现跟预期有明显差距。
同时,FLiRT变体在英国似乎也逐渐占据主导地位。当时那种跑分太猛,一定程度上影响了观感。Cov Spectrum的数据表明,KP.2和KP.1.1的组合占英国病例的40%。         当然结果是好的,起码阿里高层认可,因为负责人张迪现在一统集团的多模态视觉业务线,万相、快乐马和快乐生蚝全都并入了未来生活实验室。英国卫生安全局(UKHSA)尚未对FLiRT发表评论,但英国病例的增加可能表明它是新的主要变种。         可能也是吃过亏,阿里这次在基座模型的宣发上不敢把话彻底说满。         目前来看,“可能”这个限定词加的还是比较艺术,也比较合理。
今年5月初,世界卫生组织(WHO)已将KP.2亚变种列为监测中变异株。世卫组织COVID-19技术负责人Maria Van Kerkhove此前表示,“KP.2是JN.1的后代谱系,而JN.1是全球主要菌株,KP.2刺突蛋白有额外的突变。         因为第一波社区实测下来的结论,多数都认为qwen3.8目前的表现不如抢先发布的 k3。所以如果当初中文宣发没加这个“可能”,估计现在网上的嘲讽声已经大到难以想象。还有其他新兴变体,JN.1不断发展,我们将继续看到这些变体传播。”
不过,截至目前,中国国内尚无该毒株传播的迹象。         但官方也强调qwen3.8正在以天为单位持续进化,意思就是后训练还没做完。

七 | 据中国疾控中心公布的最新数据,2024年4月1日-4月30日,31个省(自治区、直辖市)及新疆生产建设兵团共报送11299例本土病例新冠病毒基因组有效序列,均为奥密克戎变异株。

八 |          众所周知,我们还远不知道后训练的潜力有多大,参考腾讯hy3正式版相较于preview版本的提升幅度,不排除qwen3.8正式版也拿到类似剧本,完成翻盘逆袭。         而且话说回来,哪怕qwen3.8第一时间在体验上没能盖过k3,阿里也是赚的。

九 |          阿里持有月之暗面超过30%的股权,而且训练K3的算力也主要来自阿里云。主要流行株为JN.1系列变异株,占比前三位的分别为JN.1、JN.1.4和JN.1.16。所以怎么看阿里这波都不亏:你用K3,阿里云赚算力租用费,股权跟着升值;你用Qwen,阿里占住自己的开源和云生态位。         这种左右逢源的资本与算力布局,是其他单打独斗的创业公司羡慕不来的。         算力和基础设施上的要素优势,也直接反映在了商业化定价的底气上。

(羊城晚报•羊城派综合红星新闻、财联社、中疾控官网等)
。         Kimi昨天刚刚宣布因为算力紧张不得不暂停会员开放。这就把大模型竞争最残酷的一面展现出来了。模型本身就是成本跟智能的权衡。缺乏底座云基础设施的独角兽,在突发的流量暴涨面前瞬间捉襟见肘。         而阿里这边,qwen3.8虽然能力有限,但速度快还便宜,在Kimi捉襟见肘之时,那边qwen3.8反而在搞限时一折,甚至推出了类似于传统电力系统峰谷电价的夜间折上折。         但问题是,既然明知很多训练工作没做完,后训练还在以天为单位持续进化,阿里为什么还是选择在这个节点把qwen3.8抢先推出来?          已经发布的k3和即将发布的deepseek v4正式版,肯定是关键影响因素。qwen3.8如果再拖下去,面临的不确定性实在太大了。

十 |          阿里内部对自己模型的真实水平肯定是有个比较清楚评估的。毕竟现在管理层也不是傻福,在行业内刷榜已成公开惯例的情况下,不至于像当初小扎发布LLaMA4 那样被团队拿出的版单数据完全蒙蔽。         k3发布过后,阿里上手一测,估计也发现自己的qwen3.8在绝对能力上并没有占到便宜。         而另一头,deepseek又是出了名的价格屠夫,梁圣盛名在外,其极致的工程优化和极低的推理成本是所有人头顶的悬剑。         这就构成了一个特殊的时间窗口。         如果阿里按部就班,非要等qwen3.8彻底训练完,排在deepseek v4发布后再发,那场面就会变得被动。         哪怕v4正式版的模型能力一般,但只要deepseek保持一贯的降本路线,把价格打到骨折,到时候阿里就是两头不占:论模型绝对能力,你打不过已经占领口碑高地的k3;论成本性价比,你又打不过deepseek v4。         即便qwen3.8综合来看是个很不错的模型,但一旦落入“能力比不过、价格也比不过”的两头不占境地,宣发上就会完全找不到卖点,面临极其尴尬的局面。                   qwen超大杯回归开源,林俊旸“白走”了          前段时间林俊旸从阿里离职,引发了整个大模型圈的巨大震动。关于他离职的原因,圈内传闻很多,其中一点是阿里内部在开源和闭源路线上的严重分歧与路线斗争。         林俊旸代表的,是Qwen团队早期技术理想主义。

十一 | (也可能有给自己刷成就的考虑)在他的带领下,Qwen靠着无保留的开源一路高歌猛进,在全球开发者社区打下了极高的声誉。         但这种大慈善家式的纯粹开源,随着模型参数飙升到千亿、万亿级别,必然会撞上集团财务账本这面墙。训练一次顶级大模型需要砸入天文数字的算力和资金,集团高层不可能不去算ROI。         《晚点》报道提到,qwen max阿里是不想开源的,但林俊旸也想推动开源。         开源社区的口碑有好处,但看不见摸不着。         在一部分集团高层看来,把最顶级的旗舰模型毫无保留地开源,不仅不能直接带来 API 收入,反而相当于自己花真金白银造武器,送给全行业甚至竞品用,让别人拿去抢阿里云的客户。

十二 |          林俊旸走后的一段时间里,阿里大模型的路线发生了非常明显的收缩与转向。

十三 |          旗舰模型开源步伐刹车,转而采取“中小模型开源,大模型闭源”的功利打法。         而阿里迟迟不肯开源最大尺寸的旗舰模型,也一度被外界视为阿里逐步向闭源商业化妥协、开源理想主义退潮的信号。

十四 |          比如,qwen3.6发布页面就提到,“我们还将开源更小规模的模型版本,以此重申我们对技术普惠与社区驱动创新的坚定承诺”。         这次qwen3.8发布,阿里为什么又明确宣布将开源2.4T参数的Max顶级版本呢?从收紧到重新彻底放开,这背后的逻辑转变其实并不难理解,是一次回归常识的纠偏。         说白了,大模型圈子现在情况真的就是:你不开源,有的是人开。         在这个阶段,开源的本质其实是用生态和声誉,来弥补模型绝对能力上的差距。         试想一下,如果你的模型能力真的跟OpenAI或 Anthropic有来有回、交替领先,那即便不开源,大家为了最好的效果,也会排着队来买单使用你的闭源 API。         但现在开源模型还是跟闭源模型有差距,起码从来没有超过同期最顶尖的闭源模型。         在未来,如果有一天智谱、月之暗面这样的独立大模型厂商,真的赶上OpenAI或 Anthropic,我觉得他们大概率还是会走向闭源。         因为不这样的话,抛开AGI不谈,独立厂商的可持续性就很难解决,总不能真把投资人当成客户用吧。         阿里的情况不一样。我其实一直不太理解,之前阿里内部为什么会产生“转向闭源更划算”的这种想法。         因为作为一家掌握资源优势的云厂商,又是自家练出来的基座模型,开源对阿里来说,几乎没有损失多少实质性的利益。

十五 |          就算阿里把满血权重开源出去了,别人拿去自己部署,或者中小云厂商拿去提供服务,他们在推理效率和单Token成本上,照理也不太可能达到阿里云原生部署的水平。         如果确实达到了,那只能证明阿里云太菜了。         所以,林俊旸当初因为路线分歧离开确实令人唏嘘,但好在阿里在经历了一段时间的摇摆后,最终还是算明白了这笔账。         Qwen3.8 Max重新许下开源承诺,回归过去三年的主路线,说明阿里作为云巨头终于想通了自己的核心叙事:          与其像独立模型厂商那样去抠闭源API的利润,不如大大方方地用开源模型交个朋友,用算力效率去赚整个 AI 时代“水电煤”的大钱。         蔡崇信上个月在巴黎说,AI的巨大价值是确定的,但这些价值最终汇集在哪个层次是不确定的。底层芯片、云计算基础设施、模型层以及应用层,这四个层面都有可能。阿里的思路是全栈式,也就是每个层面都做好布局。

十六 |          这个分析放到行业视角成立,但从概率上说,从营收趋势上说,阿里自己最大的机会还是在基于MaaS的云计算生意。

Current article:http://v66x.zhanggengsenchaiweikeng.cfd/list_cs8jhiy/hiurj.html

Published on:21:56:52


用户评论
用户名:
E-mail:
评价等级:               
评价内容: