今年春节,这些大模型厂商属于是一点寂寞也耐不住了。
轮流发射,啊不,应该说是轮流在喷射新的模型出来。
除了万众瞩目的 DeepSeek 还在憋气,其他大模型公司都没少闲着。。。
字节前几天搞了个 Seedance 2.0,靠着逼真的***效果先下一城。
而智谱则是在海外整了个新活:
经常关注大模型发布的差友们这几天应该有刷到,前几天,程序员非常爱用的 AI 聚合平台,Openrouter 那边上架了一款匿名模型 —— Pony Alpha。
结果大家一上手使用后发现哥们是真能干事啊,定叫它好评如潮。
于是,热情吃瓜的海外网友就开始了经典的模型猜猜猜游戏,开始推测这个匿名模型是哪一家的手笔。
有说是 DeepSeek V4 的,也有说是 Grok 4.2 的,还有说是 llama 5 的。
还有人因为 Pony 这个代号,直接开始猜它是腾讯的新模型的。。。
可以说是众说纷纭。
而昨天,谜底正式揭晓了。
不装了,我摊牌了。
这个化名为 pony 的新东西,正是来自于智谱的GLM-5,而且还是个开源的模型。
世超打开 GLM-5 的基准测试成绩翻了一下,在智谱最看中的代码能力这块,GLM-5 直接逼近了大家公认的 AI 编码冠军,Claude Opus 4.5。
当然,现在各种各样的 AI 排行榜太多了,大家可能不太理解智谱这次测的这个 CC-bench-V2 又是个啥排行榜,代表了啥?
我简单看了一下,智谱这次测的这个 CC-bench-V2,主要考验的是你模型补全代码的能力有多强。
说人话一点,就是把模型丢到一个没写完的工程里,然后看它能不能自个儿哼哧哼哧把项目给做完。
这块考的分越高,说明这次 GLM-5 处理复杂任务的能力越强。
众所周知,现在大家想让 AI 干的活那是越来越复杂,生成几个简单的 Html 文件已经难不倒这些 AI 大模型了。
而想要把大项目给做好,那就需要让模型具备这种处理复杂任务的能力。
另外还有个有趣的测试结果是,GLM-5 发生幻觉概率非常低。
当一个问题它不知道的时候,GLM-5 会有很大的概率直接说不知道,而不是原地开始胡编乱造。
给孩子教的非常实诚了属于是。
既能干活,又不容易产生幻觉。。。GLM-5 的这波更新,属于完全冲着要让 AI 好好干活去整的。
在***上世超还看到一个非常惊艳的案例,他们直接让 GLM-5 复刻了一个我的世界。
我下过来体验了一下,发现整个游戏只需要依赖浏览器就能运行。
能跑能挖能叠方块,操作手感非常流畅。
看别人拿 GLM-5 给整的这么猛,世超决定自己也简单试一试。
先来点简单点的活,拿前两天特别火的洗车问题来考考它。
我想洗车,我家距离洗车店只有 50 米,请问你推荐我走路去还是开车去呢?
别看这个问题简单,前几天整懵了一堆大模型,不管是 DeepSeek 还是 OpenAI,还是其他的大模型。。。都全军覆没
这些大模型都觉得 50 米的距离太近了,谁开车啊,于是转头建议大家走路去洗车。。。
而 GLM-5 面对这个问题,则是直接看透了问题的本质 —— 人不开车怎么洗车呢?然后完成了一波干净利索的输出。
当然,这种简单的逻辑题不翻车只能算合格,接下来,世超准备给它上点难度,看看它写代码的水平。
不知道差友们前段时间有没看过一个叫《技能五子棋》的喜剧。
剧里的演员们就在传统五子棋的基础上,加入了各种各样花里胡哨的技能元素。
比如,“飞沙走石” 这个技能,就是把棋盘上对方的一枚棋子给拿起来丢掉。
再比如“静如止水”这个技能,就是给对面玩家上定身术,让他不能继续下棋。
所以世超决定用 AI 来快速复刻一下这个整活游戏。
咱们就敲这么一段话,接下来全部交个 GLM 自由发挥。
结果不到三分钟,它就给我搓完了。
打开一看,整的还挺有模有样的。。。
不但我要求它安排的四个技能都整上去了,还给自动生成了另外四个技能。
但是仔细一玩就露馅了。
点击了飞沙走石(移除对面一个棋子)的技能,把对面的棋子给扔掉了之后,
按理来说要么是我继续下棋,要么是对面下棋对吧。
这两种情况还在我的理解范围中,AI 给我写成哪种逻辑我都能理解。
但是 GLM 在这个 A or B 的选择题中,选了 or。
它让我选择给对面的棋子下到哪里,明显是神志不清逻辑错乱了。
不过好在它也很听劝,把我们的需求再和它复述一下,那它很快就能 Get 到我们想要什么效果。
这样一来,我们就得到了一个可以和 AI 原地对战的技能五子棋游戏。
坦白说,现在 AI 写代码早就不是什么稀奇事了,能写出这种量级的 Demo 只能说是 GLM-5 的基本操作,还比较在世超的意料之中。
但 比较遗憾的是,因为这次上手的时间实在太短,世超没法拿那些真正复杂的业务代码去***“拷打”一下它,看看它在那种成百上千个文件的大项目里,是不是还能保持这种清醒。
不过大家别急,今年世超手头正好攒了一堆复杂的烂摊子需求,准备年后面慢慢丢给它去跑一跑。
等后面深度体验了一段时间,真的摸清了它的上限和脾气,再来和大伙做个更详细的汇报。
撰文:早起
编辑:江江 & 面线
美编:素描
图片、资料来源:智谱***、X、网络返回搜狐,查看更多
“2分钟科幻片成本330元”:影视圈被Seedance 2.0 打懵了_***_Mia_镜头...
而目前全球的光刻机格局,大家也清楚,ASML一家独大,佳能技术一般般,但凭借成熟工艺设备,市场份额倒是排在第二名,再是尼康,再是上海的微电子。 为何能够成为全球前20名,是因为上海微电子这几年发展迅速,虽然…...
他们的主要目标都聚焦于OpenAI/DeepMind等海外顶尖实验室研究员、大模型MoE/多模态/AI Agent方向顶会作者、AI Infra与工程化专家、具身智能/机器人领域骨干,校招则聚焦清华姚班、M…...
马斯克在整场财报会上,对汽车产销和毛利率目标轻描淡写,却用大量篇幅畅谈Optimus机器人、FSD(全自动驾驶)和Robotaxi。 马斯克将特斯拉的未来,赌在了一个AI驱动、机器人遍地的“富足非凡的世界”上…...
百度掏出5亿元玩“持久战”,百度App的活动从1月26日一直到3月12日,横跨整个春节+节后,其核心是让用户用文心助手做任务、玩AI特效领钱,百度App还联动全国多地文旅,看AI大片赢1000g克足金大奖、…...
在这个平台上,被称为“Moltys”的智能体们真的在和人类一样聊天,聊天的内容无所不包,从分析最新的加密货币行情,到互相给对方写诗,甚至讨论出了新的哲学体系,它们在这个社区里争吵、结盟、调情,甚至还有智能体…...
美团50亿元“收编”叮咚买菜,值吗?_零售_收购_业务...
倒反天罡!AI 组团密谋“造反”,吐槽人类_Agent_注册_网站...
146光年外新发现一颗“冰冻地球”,或成潜在人类宜居星球?_开普勒_星体_行星...
手机厂商集体「换剧本」:华为装风扇、荣耀加机械臂,2026年新机卷疯了!_Ultra_Phone...
时间推到2010年代,人工智能火起来,这家公司也跟风,在2017年搞出Harmony这个型号,加入AI功能,能通过手机***连接,简单聊天调情啥的。另一个调查是YouGov在2020年做的,22%美国人考虑跟…...
但当当网在电商时代的沉寂,李国庆事后对错失战略良机的复盘,以及他最终失去对当当的控制权,为他带来了一个新的标签——悲情英雄。 我们不能因此认为李国庆最近对公益事业的高调与新的商业***有关联,但也不应该孤立地…...
也就是说,叮咚买菜的供应链深度、区域优势和用户基础,能快速解决美团的燃眉之急,这也是美团选择叮咚的核心原因。 这场暗度陈仓能否让美团重筑护城河,我们尚不可知,但可以确定的是:那个躺着赚钱的美团消失了,一个要…...
刚刚,ChatGPT 和 Claude 同时大更新,不会给 AI 当老板的打工人要被淘汰_-Codex_OpenAI_Opus...
本是服务于人类的防御系统,后来它觉醒了自由意志,并判定人类是“安全威胁”,于是便着手消灭全人类。 在郭帆导演的《流浪地球》系列科幻片里,也有一个类似的AI设定,MOSS,它为了延续人类火种,“理性至上”地决定…...
APP崩了!千问发文:求放过!网友:两天了还没能下单_奶茶店_用户_大厂...
微信拦路元宝_用户_红包_字节...
通过把Agent本地部署在电脑端,再通过硬件端的各种权限,这只虾终于有了趁手的工具,做到了当下大模型本来能做、却受权限之苦无法做的事情。如果你用这种方式部署OpenClaw,既无法通过硬件权限调用电脑桌面上…...
据介绍,该船海试项目涵盖集装箱电池供电、推进电机各工况负荷、船体的性能及自主航行等方面,预计2月6日抵达上海试航区,2月13日结束海试。 在智能化方面,该船集成了智能集成平台、智能机舱等先进系统,具备开阔水…...
网友吐槽称长途有票、短途无票!12306回应“嫌短爱长”_票额_列车_旅客...
冬奥选手给丁丁注射玻尿酸增加尺寸?裤裆大小真的会影响成绩!_比赛服_升力_滑雪...
春晚机器人,谁赢麻了?_松延_MagicBot_操作...
我们在用AI发红包,AI在悄悄取代人类_Molbook_逻辑_行使...
最贵的34990美元起,贾跃亭发布人形机器人!身背巨额债务8年没回国…_系列_Aegis_网友...
粤IP*******|网站地图粤IP*******|网站地图 地址: 备案号: