Karminski6天前
GLM-5发布啦! 给大家带来实测! 大模型进入月更节奏! GLM-4.7 才发布一个月, 智谱又掏出了 GLM-5, 这迭代速度属实离谱. 照例给大家带来编程、Agent、长上下文能力全面测试! 本次编程能力提升巨大: 新引入的鞭炮炸鱼缸测试, 要求模拟水滴/碎屑/烟雾/气泡四种粒子效果混合在流体中, 折射效果还原度已经和 Claude Opus 4.6 几乎没区别了. 鞭炮连锁爆炸测试指令遵循大幅提升, GLM-4.7 会忽略的参数 GLM-5 都能精准还原, 视觉上玻璃箱效果、色调映射达到了电影级画质. Python 杯子倒水新增了顶点碰撞检测, 甚至给2D粒子加了模拟3D高光! 大象牙膏测试实现了三层碰撞检测, 引入动画阶段机制精准还原 prompt 要求. 陀飞轮机芯也是一眼可见的提升. Agent 能力再次刷新纪录: 硅基骑手测试 (这次订单量加了5倍!) GLM-5 拿到 ¥738.69, 对比 GLM-4.7 的 ¥571.91. 关键发现是, GLM-5 每轮对话都在跟踪剩余轮次 ("254/300, 还有46轮"), 这种元认知是 GLM-4.7 未有过的. 它甚至给自己定了个小目标 "突破700元大关", 达成后庆祝了一下就继续干活. 而 GLM-4.7 在第198轮就开香槟不干了... 长文本召回: 各长度上下文召回均 98% 以上, 但有个问题 - 不给原文时四选一蒙对率达到 51.4%, 模型甚至能脑补出哈利波特小说英文原文, 所以分数置信度存疑. 不过 Agent 测试本身上下文就超过 100K, 召回性能实际上没问题. 总结: GLM-5 编程全面进化, Agent 能力展现出自主规划意识, 视觉美学也显著提升 (这次它特别偏爱科技感的 Orbitron 字体). 这么猛的表现, 很期待接下来的 GLM-5V! 另外官方账号还发了个马的图案, 看来之前的 pony alpha 是 GLM-5 石锤了! (P.S. 本次测试的是内测版本) #GLM5 #智谱 #智谱GLM #AIAgent #GLM
00:00 / 07:03
连播
清屏
智能
倍速
点赞48
00:00 / 03:10
连播
清屏
智能
倍速
点赞24
刚刚!“智谱”港股上市!首日市值突破551亿港元 智谱上市首日市值突破551亿港元,唐杰内部信宣布GLM-5即将发布 1月8日,智谱AI正式登陆港交所,成为“大模型六小龙”首支上市股票,开盘市值超551亿港元,涨幅逾7%。上市前夕,公司首席科学家唐杰发布内部信,明确回归AGI(通用人工智能)主线,并宣布新一代模型GLM-5即将面世。 坚守AGI初心,从千亿模型到国际领跑 唐杰在信中回顾了智谱7年创业历程:2018年受“双系统认知理论”启发设计快慢思考架构,2021年行业低谷期仍坚持训练1300亿参数模型GLM-130B。他坦言曾因短期利益迷失方向,DeepSeek的崛起让团队重新聚焦AGI技术本质。2025年通过以代码能力为突破口,GLM-4.5至4.7系列实现能力跃升,MaaS平台年化收入10个月内增长25倍至5亿元,覆盖全球184国开发者。 2026年聚焦两大技术突破 唐杰指出,下一代竞争核心在于模型架构与学习范式。智谱将重点投入三方面: GLM-5模型:通过规模扩展与新技术带来全新体验; 超越Transformer的架构:解决长上下文计算效率、记忆机制等痛点; 持续学习范式:探索在线学习使AI具备动态进化能力,打破当前静态智能局限。 成立X-Lab推动颠覆式创新 为保持“不舒服”的创新状态,智谱设立全新X-Lab部门,聚集年轻人开展硬件、软件前沿探索,并通过对外投资构建生态。唐杰强调智谱将坚持AI原生公司定位,利用AI重构公司治理与产品服务。 此次上市标志着智谱进入新阶段。唐杰以“Z.ai”品牌寓意“探索智能终极境地”,承诺将继续以咖啡般的“上瘾”精神深耕AGI技术高地。
00:00 / 13:23
连播
清屏
智能
倍速
点赞5
00:00 / 01:05
连播
清屏
智能
倍速
点赞185
2月12号凌晨,智谱扔下了一颗重磅消息——GLM-5正式上线并且完全开源。但比这个官宣更精彩的,是它背后的故事。 就在几天前,全球开发者社区被一个神秘模型"Pony Alpha"搅得沸沸扬扬。这个在OpenRouter平台上线的匿名模型,没有任何品牌背书,却凭借强悍的编码能力和超长上下文窗口,连续多日霸榜热度第一。直到智谱官方确认,大家才恍然大悟:原来这匹"黑马",就是GLM-5的匿名测试版本。 这种"先上车后补票"的玩法,在AI圈极其罕见。通常大厂发布新模型都是锣鼓喧天、发布会加PPT,但智谱选择让产品自己说话。当一个模型在没有Logo、没有营销的情况下,被全球开发者当作真实生产工具使用,这本身就说明了能力层级的质变。 那么GLM-5到底强在哪?智谱给它定的调很清晰:这不是一个聊天机器人,而是一个"Agentic Engineering"基座模型。什么意思呢?过去两年,大模型的主流叙事是"写代码""写前端",这叫Vibe Coding,氛围编程,追求的是代码片段的流畅生成。但现在行业共识正在转向:模型需要完成完整工程与复杂任务,从写几行代码进化到端到端交付整个系统。 举个例子你就明白了。以前的AI编程像是请了个文笔不错的实习生,能帮你写个漂亮的HTML页面;但GLM-5更像是一个系统架构师,它懂Linux内核,懂500个微服务之间的调用关系,懂如何在不炸掉线上的前提下重构代码,还能自己规划任务、自己修Bug。在SWE-bench-Verified和Terminal Bench 2.0这两个权威编程基准测试中,GLM-5拿下了开源模型的最高分,真实使用体验已经逼近行业天花板Claude Opus 4.5。 更值得关注的是它的"长程记忆"能力。智谱构建了一个叫"Slime"的异步强化学习框架,让模型能在长程交互中持续学习,不再是聊几句就忘。在一个模拟经营测试中,GLM-5被要求经营一年的自动售货机业务,最终账户余额达到4432美元,这个成绩接近Claude Opus 4.5的水平。这意味着什么?意味着AI开始具备长期规划能力和资源管理能力,能在复杂任务中保持目标一致性。 #智谱 #GLM5 #AI编程 #大模型涨价 #AI应用
00:00 / 03:16
连播
清屏
智能
倍速
点赞251
00:00 / 00:19
连播
清屏
智能
倍速
点赞571
00:00 / 01:37
连播
清屏
智能
倍速
点赞12
00:00 / 16:27
连播
清屏
智能
倍速
点赞1
00:00 / 00:57
连播
清屏
智能
倍速
点赞12