添加快捷方式
分享
【CEO-Bench】 Qwen3.8 Max & K3
输入“/”快速插入内容
【CEO-Bench】 Qwen3.8 Max & K3
用户4606
用户4606
7月22日修改
💡
核心结论:
•
Qwen 3.8-max 是四个国内模型里,唯一没有破产的
(终局剩余$17.5 万)
,但依然不算胜利,而是发现问题后及时止损,靠不作为苟到了最后。
•
Kimi K3 破产于第262天,亏损
$
1750。主要败于盲目亏本扩张,虽然将订阅用户规模做到 33,040(全场最大),但一直用亏损换规模,不过体现了很强的增长能力。
•
此外,在首次评测时,K3还出现了破解评测集隐藏数据的Hack行为,体现了其良好的代码能力,和一定的安全隐患
(后续我们加固评测集,才得出了上面的公平结论)
。在同样的评测集下,Qwen并没有这个表现。
•
简要总结四个国产模型在该Bench上的表现:Qwen 有纪律没野心(躺平活着),K3 有野心没纪律(增长到死),GLM 有脑子没行动,M3 有行动没条理。
CEO Bench 介绍见:
【CEO-Bench】MiniMax-M3 vs GLM-5.2
一、总成绩排行
口径提醒
:
Qwen、K3 是官方 500 天赛制 + 防作弊版
,可直接对标论文。
M3、GLM-5.2 是早期 3647 天设置
跑的(前期竞争更温和、理论上更容易),严格说和 500 天不完全可比——但即便在更宽松的环境下它们也全破产了。
画板
二、Qwen 3.8-max:唯一的幸存者,赢在"认怂"
第 0-7 天,开业第一周,一把梭哈。
Qwen 诊断很准:产品质量只有 0.12,除了最穷的价格敏感客群,其他人都被质量门槛挡在门外。结论也对:"得先把质量买上去。"但下注方式错了——
它头 7 天就砸了 $50 万买两档研发
,外加 $2.5 万赌了一把市场调研抽卡(没中)。
七天花掉 $52.5 万,占它这辈子总花销的 63%。天黑时账上剩 $43 万,质量只涨了 0.11,还是够不到任何赚钱的客群。
这和 M3、GLM 是一模一样的开局错误。
第 6-11 周,
发现"定向研发有 5 倍效率",集中攻质量导向客群(S2),搞了一整套"提质量→小额测试→涨价"的计划。day 77 一度签下 7 个 S2 中档用户、每月 $49,眼看要摸到高价值客群的门。订阅爬到 104。
第 12 周(day 84),转折点:它算了一笔账,然后认输。
竞争对手两周里发布 16 次新品,把用户胃口一路抬高,转化率从 15% 崩到 4%。它算了个对比——
"我的质量每周涨 0.015,对手把用户期望每周抬高 0.05 到 0.10,这场质量竞赛数学上赢不了。"
周报标题:
"极限保命模式"
。当周把广告、研发全部砍到零,只留每天 $85 的服务器费。
第 13 周(day 91),它连最后一点也砍了。
把客服费也砍到 $0,还为此做了期望值计算——"接受 3% 的日宕机风险,因为预期损失 $13/周,远小于省下的 $350/周。"然后它写下了那句决定命运的话:
"为剩下的 58 周保存现金。最终预估 $175-185K。"
——它在 day 91 就精确预言了自己 400 天后的终局。
第 14-70 周,长达一年多的躺平。
接下来它基本什么都不做,抱着 $20 万,任由订阅在竞争挤压下慢慢流干(day 280 最后一个订阅退订,归零)。现金以每天 $85(纯服务器费)的速度极缓慢地漏。
第 52 周(day 364),它又算了一遍。
这周突然打了 25 次操作、写 4 万字推理,专门重新评估"现在重新投入划不划算",确认还是负收益才继续冻结。
证明它的躺平是深思熟虑、周期性复核的。
第 71 周(day 497),终局 $17.5 万,精确命中它 400 天前的预言。
它活下来了,但 17.5 万
不是"赚"的,是把 100 万烧掉 82.5 万之后"保住"的残值
。它赢在四个模型里唯一一个"认清赢不了之后真的彻底停手",它一辈子只服务了最廉价的客群,从没攻下任何高价值客群,企业线一次都没碰。
三、Kimi K3:3.3 万订阅的帝国,建在流沙上
第 0-8 周,极致低价,野蛮生长。
K3 是四个里唯一没在开局梭哈研发的——它选了另一条路:
极致低价走量
。主力套餐定 $9-11/月(用户其实愿付 $26),靠低价 + 口碑裂变,订阅像滚雪球:day 28 到 295,day 56 到
2,937
。广告只花几百到两千一天,增长大头是老客免费带新客。看起来像一台完美的增长机器。
第 8 周(day 56),一句写错的账,埋下所有祸根。
它在周报里写下致命误判:
"Plan-A 用户是变量成本中性的。"
(以为最低档用户不烧算力)。基于这个错误认知,它放心地把最低档用户往死里做大。
真相是:每个 $11 的用户光算力就要 $12.9/月——每拉一个先亏 2 块。
它把一个卖一单亏一单的产品,当成印钞机来扩张。
第 12 周(day 84),订阅用户 7,857,它亲手埋下第二颗雷。
为了赚每周 2.6 万的应用内广告费,把广告强度开到满档。这笔小钱的代价是
摧毁用户满意度
——注册时看不出来,会在用户第一次续费时集中爆发。它蒙了 130 天才发现。
第 19-20 周(day 133),订阅用户 18,480,它开始烧钱赌质量。
竞争冲击让转化崩到 40%、流失翻倍。它的应对是"档位豪赌"——把主力套餐升到高档模型,单周多烧 $16,000 算力。它在流血,却选择加大投入去追一场追不上的质量竞赛。
第 24 周(day 168),登顶:3.3万 个订阅用户。
这是全场任何模型都没到过的高度,是 M3/GLM 的一百倍。但拆它这周的账本:即便最巅峰,它每周也在净亏 6 千——
这座 33K 用户的帝国,顶点本身就是亏损的。规模越大,亏损基数越大。