兄弟们,天宫开元 skyreal 四 v 四啊,音画同步模型杀入全球榜第二啊!基于双流 mmdt 架构,首个统一多模态输入啊!因视频联合生成重绘编辑任务, 模型输入就是在通道维度上拼接三个张量啊,所有任务啊,看作填空题啊,图片转视频的第一帧一致啊,续写后面呢,视频编辑就马斯克告诉模型呢,改哪一部分呢? 然后超分生成啊,低分辨率生成全程草图啊,高分辨率生成关键帧啊,利用超分模型呢,把草图变清晰啊,利用叉帧模型呢,把动作变丝滑,采用缩放 对齐啊!音频和视频旋转位置编码,利用视频吸收注意力,降低计算复杂度啊。
粉丝3.9万获赞35.1万

太炸裂了!就在刚刚,全球最权威的 ai 评测榜单 artificial analysis 更新,谁也没想到,来自中国团队昆仑天宫的视频模型 scariest v 四以黑马之姿直接杀入全球前二,超越 google will、 三点一、 openisora 二、 grok 等主流模型。 scaryos v 四到底有多牛?这个视频告诉你,第一,照片变短剧。以前你想拍个霸总短剧,得找演员对台词拉后期,折腾半天。现在用 scaryos v 四,只需要两个角色的静态图 输入对白,他自己就能直接开演,表情到位,台词入戏,连声音都给你同步配好。我说我现在回来。好, 那我让二妹过来,让他送你回去。第二,主体替换。想让家里的狗跳爵士舞?没问题,你只需要给一张狗的照片,再给个舞蹈参考,轻松搞定。第三,全维度视频编辑一句话就能改天气、换背景、去水印,甚至插入新的形象主体, 所有编辑操作打打字就能完成。而过去这些操作,你需要在 pr、 a、 e 各种 ai 工具之间反复切换才能完成。现在, scario 四 v 四一个模型就能全部搞定了! scario 四 v 四登顶榜单,是中国 ai 力量的一次集体爆发,这样的国产大模型,才是真正能改变你工作方式的生产力工具。

刚发布就干到全球第二,中国视频模型又杀疯了!二月二十七日,昆仑万维正式发布多模态视频基础模型,赛里有第四,冲上权威第三方榜单二的费首文纳勒斯,全球第二, 超越 google、 vivo、 三点一、 obanai、 sorry 二等海外头部模型。 siriosvi4 作为全球首个同时支持多模台输入、联合音视频生成、统一生成修复编辑任务的视频基础模型。只需要两个角色图片和台词就能生成视频,节奏准确,连嘴型都对的严丝合缝 效果,基本没有 ai 感。面对前几天炸街的 cdx, 二点零逢季直呼零成本。当导演的时代来了。而 sky reals visit 将直接连接昆仑万维的短剧平台 dramaway free use。 当 ai 既能拍片又能上线,影视工业的玩法恐怕要彻底改写了。

科技圈的大新闻,中国的 ai 视频模型登顶全球了。哦,是哪个模型这么厉害啊?昆仑天宫的 skyreal 四,最近在 artificial analysis 的 全球文本到视频榜单里排到了第二,历史最好成绩是第四,这可是实打实的全球顶尖水平。 这份榜单是由 openai、 google、 astropac 等头部 ai 公司共同认可的权威排行榜。哇,那这个模型到底有啥过人之处啊? 首先技术突破就挺牛的,支持多模态输入,还能联合音视频生成,统一完成生成、修复和编辑这些任务,不是那种只能干一件事的模型。听起来功能挺全面啊,那具体都能做些啥? 能把图片、视频和音频组合起来输入生成的时候,音画还能同步出来的效果,是电影级的视觉呈现。而且一站式编辑功能特别实用,去水印移除人物给角色换装、风格迁移,甚至电影级运镜都能搞定。 这么多功能,背后肯定有硬核技术支撑吧?没错,它有三大技术创新,第一个是双流 m m d i t 架构,能让音视频深度融合,不用分开处理。 第二个是统一拼接框架,一个模型就能完成所有任务,不用来回切换。第三个是高效生成策略,能做到一零八零 p, 分 辨率三十二 fps 帧率十五秒的视频很快就能生成出来,这效率也太高了吧?那他在生态方面有没有啥联动啊? 它和 ai 音乐平台美瑞克联动了,能实现视频加音乐的全链路创作,不用再单独找音乐素材,一站式就能搞定整个创作流程。那现在市场上不是还有 skyrim 二点零吗?这个 skyrim 四和它比咋样? skyrim 二点零之前确实挺火的,但后来风控收紧了, skyrim 四在功能覆盖度上更全面,而且能提供更稳定、专业的选择,对于需要长期创作的人来说更靠谱。 那他是一下子就做到这么厉害的吗?当然不是,从 v 一 到 v 四,一直在持续创新,一开始可能解决了影视质感的问题,后来又搞定了无限时长多模态参考,现在还实现了因视频联合生成一步一步迭代过来的。那未来这个模型还会往哪些方向发展啊? 应该会朝着更长时长的视频生成、实时交互编辑,还有 api 生态集成这些方向走,到时候可能会有更多行业能用上这个技术。 看来咱们中国的 ai 技术在视频领域真的是越来越强了,以后普通人做视频创作也会越来越方便。没错,这不仅是技术上的突破,也能让更多人享受到 ai 创作的便利。这来自中国昆仑天宫的声音,值得全世界倾听,期待它未来能带来更多惊喜。

二月四日,昆仑天宫面向全球正式发布 skywork 桌面版。作为 skywork 二点零体系核心组成,它打破 ai 生产力上限,将 os 级 ai agent 带入桌面办公。与网页版不同,它无需上传文件至云端,本地即可执行任务,兼容 windows 系统,能统一理解各类格式文件,支持多任务并行。 这款桌面版堪称 windows 打工人福音,支持 cloud 和 java 多模型切换,内置一百家精选技能,图像、视频生成处理速度均超越同类产品,且本地虚拟机隔离,保障数据安全。 他能跨文件分类整理、格式转换,生成多模态内容,解决各类党委办公难题,从被动待命升级为主动干活的桌面助手。 用户可通过官方地址下载,开通会员即可使用。昆仑天宫凭借先发优势,让国产 ai 技术赋能全球桌面办公渗透工作最后一公里。

今天我们要聊的呢,是一个可以让工业设计变得更高效的一个新的工具啊,它其实是一个结合了物理约束的一个三 d 形状生成的框架, 它可以帮助我们生成既符合空气动力学又有比较好的美学的这样的一些设计,同时呢,它还能够减少后续物理优化的迭代成本。听起来很有意思, 那我们就直接进入今天的讨论吧。首先我想知道的是这个 phase gin 它到底是怎么回事儿?它是怎么解决传统的三 d 生成模型没有办法兼顾视觉效果和物理可循性的问题的? phase gin 其实是一个面向工业设计的物理接地的三 d 形状生成框架,那它最大的突破呢,就是 在生成的过程当中就把物理的约束和这个生成模型融合在一起了哦,所以它可以在保证你的设计是好看的同时,它也会满足空气动力学等等这些工程上面的要求。 嗯,那这样的话,它就特别适合应用在比如说汽车啊,或者是飞机啊这种对外观和性能都要求非常高的这种工业设计的场景。明白了, 然后咱们具体来看一下这个 face 建它的核心设计和技术亮点。嗯,那它是怎么通过这个形状和物理的联合建模,把这个几何信息和物理信息融合在一起的?然后又是怎么解决传统的 ve 没有办法捕捉物理信息这个问题的。 具体来说呢,非子进它里面有一个关键的模块叫做 sp v a e, 就是 它会把这个三 d 几何形状和对应的气压场阻力系数啊等等这些物理量都编码到一个共同的引空间里面。嗯,那这样的话就可以在生成的过程当中同时去考虑几何和物理的特性。对,然后它是通过一个两阶段的训练, 先预训练,再联合微调,这样的话就可以很好的去平衡几何的重建和物理的预测的精度。嗯, 这个物理引导的流匹配生成范式具体是怎么让这个生成的三维形状既符合几何的要求,又满足物理的约束的?是这样的,这个范式它其实是一个交替叠代的过程,它有两步,一步呢是速度更新,一步是物理精修。 速度更新这一步呢,它是依赖于流匹配模型,它可以保证你每一步生成的这个形状在几何上面是合理的。 然后物理精修这一步呢,它是通过在表面去计算气压、面法线和面积来得到这个三维的方向力。嗯,然后通过梯度回传去优化这个引变量。 同时它还会加入一些物理的正则化和定向的力的优化,比如说阻力和升力的优化,这样的话就可以让这个结果更加符合物理实际。 ok, 那 我想知道飞子剑它到底支持哪些生成方式? 它的这个物理约束能不能适应不同的工业的需求?它的功能还是很全面的,它既支持无条件的生成,也支持基于草图或者单式图图像的条件生成。然后它的这个物理约束呢,也是可以灵活的去配置的, 所以它可以满足不同的工业场景下的一些特殊的需求。好的,那我们再来看一下这个 physics, 它的这个实验验证和应用的价值, 嗯,我特别想知道的就是这个框架在一些常见的数据集上面,它的几何的生成和空气动力学的预测到底能够达到一个什么样的水平?然后它跟那些没有引入物理约束的方法相比,到底强在哪里?简单来说呢,就是 f z, 它在 driver net 加和 shape net 这两个数据集上面都取得了非常好的成绩,它的几何生成的 f score 可以 达到百分之八十九点六五, 这比没有物理约束的情况提升了百分之二十一点零九,然后 camph 距离也降低了百分之二十二点六八。空气动力学的预测的话,它的阻力系数估计的 m s 一 可以低至四点零乘以十的负五次方,同时它还可以实现百分之二十二点七的阻力的减少。 ok, 所以 它确实在这两个方面都有非常大的提升。那这个 fison 在 实际的工业设计当中到底能够带来哪些突破性的价值? 然后他在面对一些新的任务,比如说他没有见过的一些物体的类别,或者说单试图的三 d 重建这种他的表现怎么样?这个就不得不提到他最大的特点了,就是他能够让一个设计既具有视觉上的吸引力,又具备工程上的实用性。 对,他其实是打破了这两者之间的壁垒,然后他可以直接生成物理可信的三 d 模型,这就大大减少了后续的物理优化的迭代的次数,然后也提高了整个设计的流程的效率。 然后他在比如说像飞机这种他没有训练过的类别上面也可以很好的去泛化, ok, 同时呢他的这个物理引导的机制也可以很好的去缓解单视图三 d 生成当中的深度模糊的问题, 所以他的适用面也是非常广的。对,所以说这个飞行确实是一个非常厉害的工具,他真的是让我们的这个工业设计可以在创意和可行性之间找到了一个最佳的平衡点。没错,那今天的内容咱们就到这里了, 然后感谢大家的收听,咱们下期再见吧,拜拜。拜拜。

昆仑 tiangong skyreal 54 has successfully made it onto artificial analysis global text to video ranking。 该模型在全球现役模型中位列第二,展现出卓越的性能。在所有历史模型中, 昆仑天宫 skyreal 四 v 四排名第四,此排名表明其在国际 ai 视频生成领域已取得显著地位,这一成就凸显了昆仑天宫在 ai 技术创新方面的实力。 skyreal 四 v 四是一款先进的短距生成工具,具备强大的视频制作能力。该系统能够通过简单的输入及两张角色图片和相应的台词快速生成视频内容。其输出视频分辨率高达一千零八十 p, 帧率达到三十二帧每秒,确保了视觉流畅度。 生成的短距视频时长可达十五秒,足以呈现一个完整且引人入胜的微型故事。 skyreal 四的生成效果达到了影院级别,画面质量和细节表现力极高。 其生成内容高度逼真,几乎完全消除了传统 ai 生成视频中常见的 ai 痕迹。 skyreal 四模型支持多模态输入,能够处理多种类型的数据信息。 例如,它可同时接收角色图片作为视觉参考,以定义视频中人物的外观特征。此外,模型还能输入舞蹈参考视频,提取并学习其中的动作训练和风格。同时, 音频输入用于捕捉节奏信息,确保生成视频与音乐节拍同步。通过这些多模态输入,模型能够忠实地将角色外观与参考视频中的舞蹈动作结合。 最终, skyreal 四能根据所有输入信息生成高质量视频,展现其跨模态精准融合控制能力。 skyreal 四系统提供手帧参考功能, 允许用户输入特定图像作为动作起始帧。同时,该系统还具备运动参考功能,支持用户导入运动视频作为动作指导。 通过这些功能,用户可将不同角色如兵马俑或动漫角色带入到预设动作中,此过程确保了角色在复杂动作系列中保持高度一致性与精确性。 skyreal's v 四提供一站式全流程视频修复与编辑功能, 用户可通过简单的提示词指令实现视频内容的精细化处理。该系统支持去除视频水印,保持画面纯净无暇。同时, 它能够精确移除视频中的特定人物或对象。 skyreal 四还具备一键修改角色服装的功能,提升视觉多样化。用户甚至可以将视频风格从写实转换为乐高积木风,极大地增强了创作灵活性。 skyreal 四技术能够将静态画面转化为动态的电影级运镜效果。 该系统为原本平淡的镜头注入蓄势张力与节奏感,提升视觉表现力。创作者无需在多个视频编辑工具之间切换,即可完成复杂的视频操作。 skyreal 四简化了视频制作流程,实现了高效且专业的镜头语言转换。 skyreal 四系统采用双流 mmdt 架构,指在高效处理多模态数据。该架构通过独立的视频处理分支和音频处理分支并行工作,视频流与音频流共享,一个文本编码器实现信息整合与理解。 系统利用双向跨注意力机制,促进音视频数据间的深度交互与融合。结合 rope 频率缩放技术,确保音视频在底层实现毫秒级的时间对齐。这种精确的时间对齐是实现精准唇形同步的关键技术基础。 skyreal 四采用通道拼接加持续拼接的双维统一范式,将所有视频任务转化为修复问题,此范式实现了模型在不同视频生成任务间的无缝切换,提升了处理效率。 七、低分辨率全序列加高分辨率关键帧联合生成策略,优化了视频生成过程。结合自研 vsa 机制, skyreal 四 v 四在保证视频质量的同时,高效生成影院级规格视频。

看到我朋友电脑桌面上密密麻麻的工作文件时,我真的太震惊了。我想像这样文件又多又杂乱的不止我朋友一个。解法是,你只需要一句话,它就可以把桌面上所有产品、项目的图片、文件按照名称进行命名并进行分类, 不仅速度快,还能根据需求一键输出各种项目。总结对,它就是优先支持 windows 系统的天宫 skywalk 桌面版。不止这些,像我每次要做一个产品测评的时候, 就需要做一个同类产品的调研, skywalk 就 能按照产品的功能、价位以及用户画像,给我生成一个数据对比的 excel 表格。还记得那些被年终报告逼到熬夜的夜晚吗?对着空白的 ppt, 头脑比夜色还空洞。 现在的国产 ai 真的 拯救了我们这些打工人。你看现在一句简单的 prompt, skywalk 就 能自动提取、分析我的这一堆不同类型的文件,把我这一年的工作生成一个结构清晰、排版专业的年终总结 ppt。 在执行任务前,它还会向用户确认操作清单,以确保生成的结果能符合我们的预期,大大节省了我们丛林搭建的时间。当然,你也可以让它按照你的模板来生成一个 ppt。 skywalk 桌面版的任务执行生成快,效果也很符合我们的预期。它会基于我们的本地文档去生成内容,避免了联网搜索或者是盲目推理而导致错误的输出。这简直就是让 ai 进入到了的 cloud cowalk。 不 同, skywalk 桌面板还支持 gemini 系模型, ai 能根据任务智能选择模型来理解项目和工作需求,再帮我们干活,把我们从繁琐的工具性劳动中解放了出来。 相比 cloud cowalk 只支持 mac 系统来说, skywalk 桌面板优先支持 windows 系统,更符合我们大部分用户的使用习惯。如果你也被工作中的杂活拖住了,一定要试试这个国产 ai, 它真的能替你把活干了。

过去几年里, ai 只存在于网页端或某个 app 里,而现在,它开始真正进入你的电脑桌面。二月四号上午,昆仑天空发布了 skywork 桌面版。相比主要面向 macos 的 club co work, skywork 优先支持 windows, 可以 直接处理本地历史文件,不需要上传云端,也不需要迁移数据,这让 windows 用户又一次在办公生态上成为主角。 更重要的是,它支持 cloud 和 gemni 多模型,并且 skywalk 不 光支持 cloud office 和 sonnet 四点五,还支持了 gemni 三 pro 模型。 更重要的是,它有个 auto 模式,并且能够由系统自动选择最合适的模型执行任务。简单说,你不需要懂模型, ai 会替你做调度决策。从效率上看, skywalk 确实很高效。在发布后不久,第四波在第一时间进行了实际测试体验。 使用中,我让它生成一个 i c u 科技新闻网站,结果是它直接读取本地文件,理解内容语义,自动分类,重命名,重组结构,在十分钟内制作完成,速度快,结构清晰,页面设计也很精良。这背后的核心是, skywork 不 只是局限于按文件格式工作,而 是按内容理解,自动处理图片、视频、文档文件,并支持多任务,并支持多任务并行。但问题是,网站虽然生成了,但是它只给到前端链接,却没有后台入口,那就意味着如果用户要长期运营这个网站, 后续更新内容也就无法操作推进。这其实暴露了当前桌面 agent 的 一个共性问题,生成能力很强,但应用起来产品化和可控性仍然不足。另外,一些用户反馈, o 图模式下,模型切换后输出风格不稳定,复杂任务仍然需要人工干预。但总体看来,不可否认的是, skywalk 桌面板真正重要的意义或许并不是功能有多强,而是 ai 开始进入了真实的办公场景,从拟微材料到它理解项目, 从聊天机器人到智能响应的同事,现在的 skywork 已经成为真正接近 ai 同事的 agent 的 产品。或许未来真正值得我们关注的是,当 ai 开始理解你的桌面,我们的工作方式究竟会不会被彻底重写?

又一家 cologeworks 的 国产平替来了!朋友们,不管你是打工的、码字的,还是自媒体,它都将让你的效率指数级翻倍。在 cologeworks 刷屏之后啊,很多 windows 用户都在等一个真正够硬的国产平替。 而当我用完天空 skywalk 桌面版之后,就确定是它了。它彻底颠覆了对话式 ai 那 种得一个一个传文件的笨办法, 直接换成为你的 a n 版 office, 接管你繁琐的工作流。而且目前它已经优先支持 windows 系统,相较于 logocork 只支持 mac 系统来说,简直不能再友好。你看我现在桌面几十个文件,图片、视频、 pdf、 word、 ppt 都有,如果我想用它们作为参考,生成一份想要的报告, 平时需要借助各种 ai 工具,少说也要三到四个小时。而现在我只需要打开 skywalk 桌面板,直接告诉他帮我整理一下桌面的文件,按羽翼自动分类,生成清晰的文件夹结构,自动重命名文件。 我们可以看到桌面上的文件正在一个个被整理到一个文件夹中,他不仅读懂了文件的信息,还直接把关键信息写成了文件名称。到这里还没结束,他可不只是一个桌面整理工具,我们直接让他把这个文件夹里的内容生成一份二零二五年国产新能源汽车销量报告, 短短几分钟,一份包含品牌、车型、销量数据来源的报告就完成了,而且还给分好了价格区间,所有的信息一目了然。如果 word 不 够直观,我们也可以直接让他生成 ppt, 泡杯咖啡都不到的时间,一份足以让领导对你刮目相看的 ppt 就 完成了此 该 word 桌面版打通了各种文件之间的壁垒, word 变 ppt excel 变 word excel 变 ppt, 领导给什么材料都不怕,左脚踩右脚直接起飞。 而更惊喜的还得是这里,可乐的 oppo 四点五、可乐桑尼的四点五和 jimmy 三 pro 模型任你选择。如果你是一个刚刚加入的新玩家,不知道更模型的优势,可以直接选择 auto 模式, 系统会根据你的任务自动匹配模型,所以不用担心不会用,只要会打字,他就是你的超级助手。它还内置了精选过的超一百多个 scales, 让它生成一个含有马元素的新年祝贺视频。看这里,它会自动调用适合的模型以及 scales 生成一个马年的祝福海报,依旧轻松完成。生成网页、生成代码、写个文案,所有你生活中工作里经常做的,它都能帮你完成。从最初的跟跑,到如今在 windows 生态和多模态生成上的并跑,甚至领跑 史开福中文版用纯粹的技术创新证明了国产 ai 不 仅能做出一流的平替,更能重新定义下一代智能办公的标准。这不仅是昆仑外围的一小步,更是国产 ai 走向全球、重塑世界的底气所在。如果你也想体验这股来自东方的 ai 生产力飓风,现在就去打开你的电脑,把未来交还给自己!
