把海外网友晃瞎的神秘大模型,还是中国制造。_智谱_世超_DeepSeek
- 发表时间:2026-09-08 08:01:53
- 来源:
今年春节,这些大模型厂商属于是一点寂寞也耐不住了。
轮流发射,啊不,应该说是轮流在喷射新的模型出来。
除了万众瞩目的 DeepSeek 还在憋气,其他大模型公司都没少闲着。。。
字节前几天搞了个 Seedance 2.0,靠着逼真的***效果先下一城。
而智谱则是在海外整了个新活:
经常关注大模型发布的差友们这几天应该有刷到,前几天,程序员非常爱用的 AI 聚合平台,Openrouter 那边上架了一款匿名模型 —— Pony Alpha。
结果大家一上手使用后发现哥们是真能干事啊,定叫它好评如潮。
于是,热情吃瓜的海外网友就开始了经典的模型猜猜猜游戏,开始推测这个匿名模型是哪一家的手笔。
有说是 DeepSeek V4 的,也有说是 Grok 4.2 的,还有说是 llama 5 的。
还有人因为 Pony 这个代号,直接开始猜它是腾讯的新模型的。。。
可以说是众说纷纭。
而昨天,谜底正式揭晓了。
不装了,我摊牌了。
这个化名为 pony 的新东西,正是来自于智谱的GLM-5,而且还是个开源的模型。
世超打开 GLM-5 的基准测试成绩翻了一下,在智谱最看中的代码能力这块,GLM-5 直接逼近了大家公认的 AI 编码冠军,Claude Opus 4.5。
当然,现在各种各样的 AI 排行榜太多了,大家可能不太理解智谱这次测的这个 CC-bench-V2 又是个啥排行榜,代表了啥?
我简单看了一下,智谱这次测的这个 CC-bench-V2,主要考验的是你模型补全代码的能力有多强。
说人话一点,就是把模型丢到一个没写完的工程里,然后看它能不能自个儿哼哧哼哧把项目给做完。
这块考的分越高,说明这次 GLM-5 处理复杂任务的能力越强。
众所周知,现在大家想让 AI 干的活那是越来越复杂,生成几个简单的 Html 文件已经难不倒这些 AI 大模型了。
而想要把大项目给做好,那就需要让模型具备这种处理复杂任务的能力。
另外还有个有趣的测试结果是,GLM-5 发生幻觉概率非常低。
当一个问题它不知道的时候,GLM-5 会有很大的概率直接说不知道,而不是原地开始胡编乱造。
给孩子教的非常实诚了属于是。
既能干活,又不容易产生幻觉。。。GLM-5 的这波更新,属于完全冲着要让 AI 好好干活去整的。
在***上世超还看到一个非常惊艳的案例,他们直接让 GLM-5 复刻了一个我的世界。
我下过来体验了一下,发现整个游戏只需要依赖浏览器就能运行。
能跑能挖能叠方块,操作手感非常流畅。
看别人拿 GLM-5 给整的这么猛,世超决定自己也简单试一试。
先来点简单点的活,拿前两天特别火的洗车问题来考考它。
我想洗车,我家距离洗车店只有 50 米,请问你推荐我走路去还是开车去呢?
别看这个问题简单,前几天整懵了一堆大模型,不管是 DeepSeek 还是 OpenAI,还是其他的大模型。。。都全军覆没
这些大模型都觉得 50 米的距离太近了,谁开车啊,于是转头建议大家走路去洗车。。。
而 GLM-5 面对这个问题,则是直接看透了问题的本质 —— 人不开车怎么洗车呢?然后完成了一波干净利索的输出。
当然,这种简单的逻辑题不翻车只能算合格,接下来,世超准备给它上点难度,看看它写代码的水平。
不知道差友们前段时间有没看过一个叫《技能五子棋》的喜剧。
剧里的演员们就在传统五子棋的基础上,加入了各种各样花里胡哨的技能元素。
比如,“飞沙走石” 这个技能,就是把棋盘上对方的一枚棋子给拿起来丢掉。
再比如“静如止水”这个技能,就是给对面玩家上定身术,让他不能继续下棋。
所以世超决定用 AI 来快速复刻一下这个整活游戏。
咱们就敲这么一段话,接下来全部交个 GLM 自由发挥。
结果不到三分钟,它就给我搓完了。
打开一看,整的还挺有模有样的。。。
不但我要求它安排的四个技能都整上去了,还给自动生成了另外四个技能。
但是仔细一玩就露馅了。
点击了飞沙走石(移除对面一个棋子)的技能,把对面的棋子给扔掉了之后,
按理来说要么是我继续下棋,要么是对面下棋对吧。
这两种情况还在我的理解范围中,AI 给我写成哪种逻辑我都能理解。
但是 GLM 在这个 A or B 的选择题中,选了 or。
它让我选择给对面的棋子下到哪里,明显是神志不清逻辑错乱了。
不过好在它也很听劝,把我们的需求再和它复述一下,那它很快就能 Get 到我们想要什么效果。
这样一来,我们就得到了一个可以和 AI 原地对战的技能五子棋游戏。
坦白说,现在 AI 写代码早就不是什么稀奇事了,能写出这种量级的 Demo 只能说是 GLM-5 的基本操作,还比较在世超的意料之中。
但 比较遗憾的是,因为这次上手的时间实在太短,世超没法拿那些真正复杂的业务代码去***“拷打”一下它,看看它在那种成百上千个文件的大项目里,是不是还能保持这种清醒。
不过大家别急,今年世超手头正好攒了一堆复杂的烂摊子需求,准备年后面慢慢丢给它去跑一跑。
等后面深度体验了一段时间,真的摸清了它的上限和脾气,再来和大伙做个更详细的汇报。
撰文:早起
编辑:江江 & 面线
美编:素描
图片、资料来源:智谱***、X、网络返回搜狐,查看更多
- 2026-09-08 05:51:41测试得分第一!国产C86 CPU芯片,拿下第一名_Cloud_性能_服务器
- 2026-09-08 15:02:29关于SpaceX在月球和火星上建城市,马斯克给出时间表_公司_企业_张江平
- 2026-09-07 00:01:34硅谷最新调研:2026 年,AI Agent 到底会走向哪?_智能_组织_生产方式
- 2026-09-08 06:22:07对话华东理工曾惠丹:日本一块布,如何卡住英伟达的“脖子”?中国做不出来吗?_日东_科技_芯片
- 2026-09-08 12:35:22姚顺雨腾讯第一篇论文,道破为什么AI死活听不懂人话_CL-bench_模型_上下文
- 2026-09-08 13:31:22别被「百模大战」骗了_模型_ChatGPT_中国
- 2026-09-08 04:31:21苹果杀疯了:iPhone大卖,AI变阵_设备_同比增长_业务
- 2026-09-07 11:02:33机器人“内卷”给14亿人看_公司_宇树_舞台
- 2026-09-08 00:45:40红包厂的春节突围战_工艺_陈小英_消费者
- 2026-09-08 02:31:24刷屏的机器人,还困在「数据流水线」里_训练_物理_场景
-
3157亿市场背后,AI医疗为何跑不通最后100米?_模型_阿福_蚂蚁
从产品形态来看,目前国内头部大厂的医疗AI尝试多集中在C端,这些应用以“健康管家”或“健康助手”为定位,提供的服务多为健康科普、疾病咨询、报告解读、链接医生线上问诊等,,如“讯飞晓医”、蚂蚁“阿福”,以及字… -
机器人“内卷”给14亿人看_公司_宇树_舞台
其人形机器人与四足机器人在过去一年里频繁出现在短***平台中,甚至已经成为一种“流量密码”;***通用则在资本市场声量极高,目前估值已达30亿美元,背后站着美团等产业资本;魔法原子和松延动力两家,前者是追觅科技“… -
热搜爆了!机器人“扎堆”上春晚,表演翻跟头、“伸头”绝技、蔡明时隔多年又和机器人联动了_宇树_公司_通用
节目单显示,松延动力、宇树科技、魔法原子等多家机器人公司将登上春晚舞台。 据公开资料,魔法原子成立于2024年1月,专注于通用机器人和具身智能技术研发与落地应用,核心团队均来自具身智能行业及产业链顶尖企业,其… -
中国第一大忽悠,又“杀”回来了_贾跃亭_机器人_生态化
中国第一大忽悠,又“杀”回来了_贾跃亭_机器人_生态化
- 最懂 iPhone 相机的人,回到苹果了_de_Pro_应用
- 从春晚看,具身智能从炫技到落地的关键一年_机器人_宇树_科技
- 章晓萍、边东,被撤销“人民满意的公务员”称号,收回并注销奖励证书奖章,追缴奖金_内蒙古_同志_处分
- 腾讯需要下一个“微信”,但它不一定是元宝派_社交_红包_产品
- 印度一大学买宇树科技机器狗冒充自研,光速露馅_加尔戈蒂亚斯_社交_媒体
- AI购物,攻陷县城大妈_吴冉冉_奶茶_父母
- 春节车市观察:以旧换新补贴“放大招”,多家车企技术“突围”_汽车_政策_新能源
- OpenAI 再不上市,财务窟窿就要把巨头们拖垮了_用户_预测_ChatGPT
- 追觅俞浩再怼马斯克:喜欢PUA,去火星太扯淡_地球_人类_收购
- 日本宣称:6000米深海挖到稀土了?成本高到离谱!想摆脱中国控制,纯属做梦?_技术难度_海底_淤泥
- OpenAI 再不上市,财务窟窿就要把巨头们拖垮了_用户_预测_ChatGPT
- 苹果2026爆发式更新:换模Mac、重塑iPhone形态,为下一个十年铺路?_Pro_芯片_Studio
- 新东方盯上爸妈,卖课还是卖陪伴?_银发_教育_主营业务
- 和机器人发生关系?有调查显示:近一半美国男性对此表示十分乐意_***_Abyss_社会
- 张雷获国际能源界顶级殊荣:为文明新繁荣,打造永续、智能、普惠的未来能源底座_全球_人类_中国
- 为什么车企都想要变成 AI 公司?_特斯拉_自动_人工智能
- 十年前的百度,聚拢了硅谷最杰出的天才,每个都比姚顺雨耀眼……_研究_吴恩达_达里奥·阿莫迪
- “硅基少女”Moya亮相上海!全球首款完全仿生机器人,能走会说还会“脸红”_卓益得_自由度_温度

