粉丝2581获赞4169

各位朋友们,我们现在在天山山脉 g 二幺八国道上面做直播,我们用的是鲲鹏 c 两千 max, 全程提供网络保障。 当前鲲鹏张导在法国噶那参加中国之夜活动,中国之夜活动的全程网络保障也是由鲲鹏 c 两千 max 独家提供。鲲鹏 c 两千 max 为什么这么强?因为他用了华为海思八龙的五 g 芯片, 他的弱信号、强网能力特别强。经历了高铁直播、高速直播、地铁直播、 轮船直播、万人演唱会直播,我们现在就是在天山山脉 g 二幺八国道上面直播,需要做直播的朋友可以关注我们的鲲鹏 c 两千 max, 关注鲲鹏张岛。

学校校园网又贵又卡,今天开箱实测鲲鹏两千,看看他能不能平替校园网。我们先来开箱,看看里面都有什么, 一个产品说明书,五 g 高速流量卡,鲲鹏两千的本地一个充电线,里面的配置还是很简单,还有一个卡针先来激活这个网速,现在已经激活完了,我们只需要把电插上就可以使用,然后连上 wifi, 直接测个网速, 下行速率一百三十二。现在我们把校园网连上,再来测个速,校园网下行速率三百二十一,上行速率三十八。 这昆鹏两千刷视频也是很流畅的, 但是就是信号太差了,现在是红色的,最好的信号状态是蓝色, 所以这个设备优点很实在,方便便宜,而且不限设备,如果你们寝室的信号非常好,全宿舍一起用完全没有问题。缺点也实话实说,宿舍角落的信号可能会弱一点,而且追求极致的电竞玩家可能不太够。 总的来说,想换掉校园网的宿舍党,这个真的可以充一下评论区,打出你校园网多少钱,我可以帮你算一下值不值。

编译调试工具编译调试鲲鹏编译调试插件支持鲲鹏平台远程调试能力。单击鲲鹏编译调试插件,进入编译调试入口界面, 您可以选择编译调试和鲲鹏调试器两种调试类型。 选择目标服务器模块中的配置服务器,进行目标服务器配置, 填写目标服务器参数,输入服务器 ip 地址、 s s h 端口以及 s s h 用户名、密码等参数, 单击开始配置,添加目标服务器,单击确认完成服务器配置。 提供服务器管理功能,可添加、修改、删除。一键式登录服务器 提供自动上传功能,开启该功能后,发生变更的源码文件 会自动同步到远程。目标服务器 提供手动上传功能,单击鼠标右键选择同步代码到远端服务器,可将本地代码上传到远端服务器。 编译调试插件支持一键式部署编译器 gcc for open ola 毕生 gdk 毕生编译器。 单机创建编译任务,可视化配置编译任务,支持创建自动反馈优化任务。 目前华为 gcc for openola 变异器可以根据用户实际业务性能特征反馈,进一步优化应用性能。 单机运行开始一键式编译任务, 提供鲲鹏亲和分析引导,可根据工程需要进行相关功能操作。 程序编译成功后,在输出端可以查看到编译成功的回显信息。 单击添加测试,用力进行可视化调试。运行配置 提供运行和调试两种模式,单击第八个 alt 进入调试模式, 支持远程单步调试。 c c 加加代码。 调试过程中,程序关键信息会进行实时展示,提供变量监视、调用、 堆展、断点等调试功能。


最近在红色沙漠里泡了快三百小时,这游戏真的是典型的神龟两相性画面和开放世界的探索感没得说,唯独原装设备的按键交互简直是灾难级别的,各种组合键冲突,常用功能绑在反人类按键上,游戏本身还不支持自行改键,这遭陷田从进游戏开始就没有断过。 不过目前我还在慢悠悠的跑图闲逛末世中,之后王将会单独开启好好唠唠这款游戏本身。而如果你也正在被红色沙漠这反人类的按键交互搞的头大,那一定要来试试王将最近挖到的宝贝北斗鲲鹏四零智控游戏手柄。 我跟他玩了十来天快一百小时红色沙漠直接把之前的糟心体验全给救回来了,跑图战斗流畅度直接上了好几个台阶。 而手柄首先怎样,要先看颜值,王姐手里的这款是玉凯白配色,纯净的白机身搭配灰色的摇杆和握把作为撞色, 简约干净。不管是搭配 ps 五主机还是摆到桌面桌搭里都毫无违和感。正面的品牌 logo 和握把两侧的 r g b 灯条还能自定光效,晚上关灯玩游戏的时候氛围感直接拉满,而且又不会像那种浮夸的灯效晃眼睛。并且它还是磁吸面壳设计, 以后还能换不同的个性面壳,打造自己的专属手柄。换面壳的时候,手柄的所有按键、灯光等设置也会自动切换到对应的配置,无论是美观还是实用性都拉满。这款手柄最顶的顶之一就是全平台通知,首先支持有线、 usb、 无线蓝牙共三种连接方式。 另外不管你是 pc、 ps 五 n s 还是手机、平板甚至车机,一个手柄就能全搞定。估计不少客观会疑惑,非 ps 手柄怎么连 ps 五玩?其实很简单,玩家之前专门讲过,这里给没看过之前教程的客观划一个重点,就在玩家公众号下方菜单栏下载好 ps 五的 app, 苹果手机可在商店里下载注册新的 ps 五主机,输入主机上的远程游玩识别码,并登录你的 ps 账号,让主机和手机连同一个 wifi, 然后把手柄拨到蓝牙模式连手机,最后在 app 里选本地连接就行了,这样就能用它来玩 ps 五的所有游戏了。而且因为是本地局域网,连接延迟低到几乎感觉不到,要是你是 pc 玩家,那就更省心了。 steam、 apac 这些平台全都是即插即玩,不用装任何驱动,插上去就能玩懒人狂系。 而玩红色沙漠用这款手柄玩的爽,最核心的就是它这六个可自定义的额外按键,把手柄拨到 app 模式,连北通游戏厅所有按键都能随便改,单个按键、组合键甚至红都能自定义,完美解决了红色沙漠的反人类键位问题。 就比如游戏里的超好用的法则之力,不管是爬岩壁、快速移动,还是战斗解谜,这个技能使用力高到离谱,结果游戏居然把它绑在了 l 三按键上,而左摇杆本来就要控制方向,同时还要按下去,那叫一个别扭。警察按 l 三的摇杆没推稳,直接从岩壁上掉下去,重爬好几次,心态都要炸了。 不管是 l 三,还有 r 三、 r 加 r 二的组合键、吃药键,有的时候比上这些按键要么难按,要么是要同时按好几个手指,无论战斗还是探途都不舒服。 并且 psu l 三按键长时间使用还容易发生漂移,万向之间就有过前车之鉴。但有了鲲鹏四零就不一样了,我直接把 l 三和 r 三映射到了下方这两个倍镜上,用无名指就能单独按,完全不影响摇杆推方向。现在爬墙开法拉兹力都稳的一批,再也不会掉下来。 l 三加 r 三这常用的拧身技能随手就放,而且这两个倍镜还是磁吸的支持水平,四十五度、九十度三档角度调节,我这种中大手都可以调到最顺手的角度,小手的朋友也能调到适合自己的位置,如果不想用还能直接拆掉。背部平平整整,完全并无物处 要向手柄本质的仿生握把设计,不管你是大手还是小手,都能完美贴合掌心。 ps 五和 n s 手柄有一个最大的问题就是玩久后汗手就会滑。而北通鲲鹏四零的握把两侧是晶莹皮纹包胶,防滑防汗还防油,实测手心出汗的手柄也不会滑,真正做到了久玩不累。 剩下的中间两个备件,我一个试了空中秋千的动作,一键就能出发,不用再按一对组合键。另一个直接试了吃药键,毕竟玩魂之沙漠不是在干饭就是在去干饭的路上,把吃药放备件,比原来按十字键方便太多了,不用把拇指从摇杆上移开,随时随手就能按,保命都快了不少。 顶部的两个额外按键,我分别映示了 l 一 加 r 一 和 l 二加 r 这两个战斗长的组合键,原来要同时按两个手指才能触发的连招,现在按一个键就能搞定,战斗的时候脸能够顺畅。当然,如果你长的是 r 一 加 o 或是 r 一 加 x 这类组合,或者更喜欢徒手的战斗,也能自己改怎么顺手怎么来。 而且它的 abxy 按键用的是旗舰鲲鹏麒麟同款的光轴,三点零零点二五毫米的超短进程,触发速度比普通按键快了快三倍。战斗的时候连招释放快了一步,按压的手感也特别爽, 清脆,回弹有力,按久了也不会累,八千万次的按压寿命,随便用个五六年都不会坏。除了按键,摇杆也是创新黑科技,首创的上纤维阻尼可调 tmr 摇杆。首先是齿轮阻尼纤维结构, 如二十五档超精准的祖尼,每一档都能精准到二点四 g f, 站下就能听到清晰的齿轮咔哒声。不同的游戏能调到最顺手的手感。比如玩射击游戏要快速拉枪,那就把祖尼调小,再换上附着的高腰杆,瞄准精度直接拉满。玩动作游戏时候就把祖尼调大一点, 玩红色沙漠日常就调到中间档,跑头很稳,去阿比斯解密的时候就加大点阻尼,瞄准物件的时候更稳,不会手抖瞄歪。要是玩格斗游戏,就换成低摇杆,走位反应更快,搓揉更丝滑。这个摇杆是超越库尔摇杆的 t m 二摇杆,而另外一个零接触的防磨损纤维结构是无接触的设计, 从根源上杜绝了摇杆飘逸的问题,耐用性比普通炭摩摇杆强太多,再也不用频繁换手柄。这个扳机键首先能一键切换长短行程,玩射击游戏就切零点三毫米的微动,短行程点击爽脆开枪反应快到离谱。玩赛车游戏就换成八毫米的长行程, 油门、刹车的限速控制精准到离谱,就像开真车一样,细腻的触放都能感受到。而且就算用 ps a p p, 连 ps 五玩游戏里的震动也能完美同步,开机关和敌人对砍采矿的时候,战感也能精准传到手柄里。 不过把和扳机共四个震动马达,沉浸感直接拉满,震动手感还能多档位调节,想要强一点的反馈还是弱一点的,都能自己调,舒服得很。如果你在 pc 上玩游戏,还可以体验到它的 ai 黑科技,就算游戏本身没有做震动反馈的场景, ai 也能识别你的动作,给你匹配对应的震感。 针对黑神话、原生明朝等游戏的不同技能,还做了不同战斗,体验感拉满。还有一些很创新的智控功能,比如 ai 语音控制指令,一句话就能多指定执行,不用中途退出游戏区调节。更细致的是,你在北通智控 app 里,还可以微调扳机区的死区、摇杆的曲线、死区边缘形状等等 五十多项参数可以调,属于是私人定制了。不想动脑那官方也提现了,根据不同类型游戏做了四种方案,直接一键切换。 手柄的电量也非常扎实,内置一千毫安的大电池,日常玩游戏满电情况下,就算我连续玩十个小时,手柄显示都还有一半的电量,彻底告别了玩到一半突然没电的尴尬。最先的还是价格了,这么顶的配置居然只要三百出头,不管是哪个平台的玩家,性价比都是直接拉满。 当然买的话我更建议大家入手带智能充电底座的套餐,手柄往上一放就能自动充电,拿起来就能玩,完全不用插线折腾。而且这个充电底座本身还是个 usb 拓展屋,平时桌面接口不够用的时候,还能插 u 盘、接鼠标、键盘或者收纳手柄的 usb 接收器,一举两得。 感谢客官,快去看看哦!我是王强,我们下期再见!

今天呢,我们用鲲鹏 c 两千 max 以及鸿蒙智选幺五三杠三八幺来做一个网速对比测试,每台设备都分别测两次网速,取最高值来进行对比,这个是鲲鹏 c 两千 max, 目前售价在一千一百元, 这个是鸿蒙智选幺五三杠三八幺,目前售价将近九百元一台,便宜的时候七百元就可以拿下。我们先来看鲲鹏 c 两千 max 的 网速表现,可以看到目前手机已经连接成功开始测试, 在我这个环境下,目前第一次测试网速为二百八十二 mps, 我 们再来测试一次, 第二次的测试有明显提高,下行速度峰值达到了四百二十五 m b p s。 然后我们来测试鸿蒙智选幺五三杠三八幺,可以看一下,目前手机已经连接 开始第一次测试, 可以看到第一次的测试网速为四百一十四 m b p s。 我 们再来测试一次, 第二次的测试网速超越了鲲鹏 c 两千 max, 为四百四十七 m b p s, 但是超越并不大,所以说两者之间的网速基本是差不多的。行了,那么关于本期测评到这里就结束了,大家觉得这台设备哪一台的表现会更强一点呢?评论区聊聊看。

离线国产化信创环境安装开源容器平台只需要两步就能搞定。我现在用鲲鹏四核八 g 的 机器,麒麟的操作系统纯国产化信创环境进行部署。 第一步,把安装需要的东西提前准备好,下载 arm 的 roi 工具以及平台需要的依赖,镜像和安装包都会被打到 offline packages 目录里。 第二步就是在目标服务器上执行安装命令,安装流程基本交给 roi, 后面会自动完成环境检查。 k 八 s 安装离线镜像加载 ringband 组建部署, 你不用在离线服务器上手动处理一堆 kubernetis 依赖,也不用一条条导入组建镜像。安装完成后,日记里会出现访问入口,浏览器打开就能进入 ringband 控制台,可以在集群管理中查看 pod 和集群信息,详细配置可以参考文档,快去试试吧!

今天我们有幸参加了鲲鹏升腾开发者大会,虽然今天下雨啊,但是人还是还是很多的,那我们赶紧进去看看到底是什么情况, 这是我们本次展示最重点的升腾 d t 系列,左边是阿特拉斯九五零 superport 的 超级点的单机柜, 整个单柜拥有六十四张升腾九五零 d t, 显存达到了六个 tb, 可以 看到每一层有八张升腾九五零 d t, 整机算力在 ip 四的情况下达到了一百二十八 p 的 这样一个高度,整个机柜都是采用了全液冷的这样一个方案。 而右边这台呢是风冷版本的九五零 d t 服务器,阿拉斯八百亿超节点拥有十 cu 的 这样一个高度, 其内部则是搭载了八张升腾九五零 dt, 整机的算力在混合 ip 四的情况下达到了十二到十四 p flops, 并且呢可以支持多台超级点服务器的组合链接。 ok, 我 们继续往后走, 这个就是我们本次 k a d c 的 o p 环节的展台啊,未来两天在这里面会群龙荟萃,不管是鲲鹏的还是生腾的,大家都会介绍自己最新的解决方案以及呢落地场景啊,当然了,二十三号我们龙金科技 啊下午也会在这里有一场关于这个数据治理的环节,所以说希望大家过来捧场,谢谢。这边就是我们龙精自己的展台啊,这次我们来也是带来了我们最新款的一体机服务器啊,是单独的昆鹏主板加上两张夜冷的升腾三百二十二六十四 g 的 显卡, 我们整个软件的技术站啊,可以看到我们底层的话是适配了所有的这个升腾的硬件,然后呢在中台里面,我们左侧的话,这个, 呃数据治理平台,也就是我们的 data ident, 左手是连接客户的数据库啊,右手是连接我们 s v 伙伴的啊,这样一个智能体。然后我们的龙 pass, 也就是我们的算力管理平台啊,是为了我们的这个用户在无缝的使用啊,生成的这个硬件可以直接 原生长在我们这个平台上面啊。再往上一层呢,就是说我们跟我们的 s v 以及我们自己做过的一些啊,一种的电力, 这里就是我们的加玛石刻,也是我们补充能量的地方。有没有看到这么大的 logo, 非常的帅气啊,这是我们的餐盒上也有 logo 的 付出。 嗯,这次展会上还有很多有趣的活动以及有趣的机器,欢迎大家前来参观,谢谢大家,拜拜。

给大家分享一期 c 二零零零 max 到手的使用教程和不同场景下的实际使用体验。 先是一张欢迎使用盒说明书二合一的卡片,然后还有一张内置卡的卡片。拿出机器,把盒子放一边,盒子下面一层是有一套 p d 充电器, 它是可以使用充电宝供电的,也就能方便带出去使用,比市面上的 c p e 都要便捷不少,但它的性能并不比其他 c p e 弱, 插上充电线,稍等,一分钟左右即可使用。 电源信号灯变绿了,我们拿出手机连接它的 wifi, 默认的秘密在包装盒上写着的 开箱使用部分展示到这儿。后面是实际的场景下的体验。首先是在宿舍里使用场景,信号强度负六十九,很不错。然后这是刷抖音的体验,很丝滑,加载速度很快。 再来测个速度。 接下来是环境展示,确实是在宿舍周围都是种的庄稼,为了避免误差,我还用备用机再测试了一遍,备用机是一七年初的 iphone x, 不 支持 wifi, 七速度可能跑不满。 然后进行户外测试, 依旧环境展示, 还是来刷抖音,这这样应该能还原正常使用的场景了。 再来测个速度, 确认场景没有变化,然后在车上的表现 直接切换直播,给它上上压力。 再来测个速度。 在北京的周一下午下班点晚高峰测试,在挤满人的公交车上,还是选择抖音。刷直播测试, 依旧测个速度。

提升矿场运输效率,助理访口、自动驾驶,加速制造质检进程, 实现智能定力分析 a i, 丰富工作和生活,让驾驶轻松充满乐趣。颠覆智能体工作方式, 在数字世界复刻空间,使旅行体验丰富多彩。化身我们的智能伙伴 升腾 ai, 与时代共进,让智能无所不在! 一代人有一代人的创新,一代人有一代人的远志, 升腾以向上的力量,与 ai 理想家一起做新时代的开创者。 向上共创 ai 普惠时代,以架构创新筑筑坚实底座, 以开源开发激发蓬勃力量,让技术平权,让 ai 普惠为世界提供新的选择。 向上共创 ai 自由时代全球开发者灵感在这里汇聚, ai 人才新星在这里冉冉升起, 万千伙伴在这里创造非凡价值。向上共创 ai 加时代,让交互深入人心,让智能驱动效率, 让风控规避风险,让智能拥有在体,让驾驶充满乐趣。 每个伟大的时代背后,皆是无数人共同的托举, 升腾与有志者一起坚定向上,与时代共升腾! 好的,然后大家好,然后欢迎来到鲲鹏升腾创享音乐直播间,我是升腾 agent 技术专家杨宏伟,今天直播的主题是 agent 升级, 然后智能高效,重塑 ai 开发体系,核心内容是探讨一下当前 agent 的 发展路径,对开发效率的提升以及 agent 工具的落地实践。然后今天我们也有幸邀请到上海人工智能实验室的专家以及两位升腾的专家一起探讨这些问题。 本次直播鼓励大家积极提问,我们会在评论区实时收集大家的问题,并请相关的专家进行解答。 好的,然后首先,呃请各位专家和线上的观众们打个招呼吧。啊,大家好,我是来自上海人工智能实验室 dplink 团队的赵朝兴。嗯,很高兴在这里和大家见面。 呃,大家好,我是冯彤,主要研究升腾蒜子自动生成技术,然后负责 cambote 的 设计开发。 大家好,我是升腾 masu 工具链团队的吴文杰,主要研究在训练推理蒜子场景下的自动化的调试调优。 嗯,再次欢迎各位专家的到场。然后这两年的话,大模型还有 agent 技术发展非常迅速,早已经不是简单的聊天对话 chatbot 这种形式,而是走进真实的业务场景。那我们就顺势针对 agent 的 发展趋势。呃,打开聊一下。 首先进入第一个话题,然后 agent 对 于开发者来说,然后最大的价值是什么呢?然后下面的话请咱们这个赵老师,然后给大家做一个分享。 好。呃,因为我是 deeplink 团队,然后之前是主要做算子开发的。 呃,之前在 agent 之前,我们用大模型可以辅助做一些算子开发的工作,比如让大模型先生成一版,然后我们人工的再进行修改。 但后来也就是去年,我们发现,呃可以基于 agent, 然后再做一些工程化的一些封装, 然后让它能够产生比直接调用大模型更大价值的这种这种形式。所以说我们就发现那个,对于这种,呃算子开发这种场景,我们就开发了 control swift 的 这么一个系统来,呃, 就是将这个固定的流程啊,明确的规则呀,然后抽象成了具体的步骤,然后,呃做了一个这么一个能够自动化生成这种生产环境直接使用的这种,呃,这种蒜子, 哎,对, ok。 然后蜂糖,呃,我这边其实也是主要做一些蒜子开发的一个工作,然后癌症 最大的价值来说就是降低了升腾,呃算子开发的一个学习门槛,然后新手的话使用对应的一些 skill, 算子生成的 skill 可以 快速生成一个可用的一个算子, 呃降低了就是生态适配的一个学习的成本,同时它对算子开发效率也有一个很大的一个提升。呃可以基于 skill 然后生成一个算子的初始版本,然后开发者可以基于初始版本更多地去关注性能优化, 对算子整体的,呃开发效率提升还是很大的。好的好,文杰 啊,我这边呢主要是研究那个在我们深腾做开发调试这块啊,所以呢,从以前我们跟模型的交互呢,更多是比如我们来问,模型来答, 但现在 agent 呢,更多是我们给一个目标, agent 能够基于这个目标做一个反馈式的一个自闭环的一个任务 啊。所以呢,在调试调优领域其实会存在大量的比如说这种重复性的消融实验,或者说流程确定性的步骤,这些是完全可以交给 agent 去做的。一方面呢能够啊提效,就是说对于一些 那个利用率的提升,另外一方面呢,就是说能大幅降低准入的一些门槛,能让更多的开发者深入到深腾的开发流程里来。嗯,好的,然后三位专家的话对于这个最大的价值做了一些分享。那么我们进入第二个话题, 对大模型本身其实他不懂行业的一些隐形的一些规则, 特别是我们代码实现了一些工程细节,然后 a 证呢,是如何承载固化开发者的一些经验和有一些工作流呢?然后下面的话还是请三位老师进行一个分享,然后咱们还是先从赵老师开始吧。 嗯,好,嗯,确实是这样子,因为我们在直接调用大模型的时候,有时候之前还会出现一些幻觉,然后包括我们自己的一些知识,然后大模型肯定也是不懂的。 所以说现在基于 agent 开发,我们大概有两个方面吧,一个方面是可以将一些知识以知识库的形式,然后由 agent 将这一个知识呃来 呃交付给大模型。另外一个是在工程控制上,我们现在基于 agent 也可以做一些呃控制流上面的一些一些工作,让大模型能够按照呃这种固定的这种流程,然后一步一步地去自己去做事情,大概是这样子, 嗯,好的,然后分团对我,我很我很同意赵老师的那个观点。 呃,目前的话,我们就主要是深度呃沉淀了,就是升腾微架构下的像蒜子的它令切分呃流水编排,然后访存优化等一些专家调优的经验,然后到蒜子的 skill 呃库里面, 然后帮助大模型来呃增强对升腾蒜子开发的一个理解。同时我们 呃也固化了,就是蒜子成熟的一个开发的流程,让让 edent 通过呃 呃设计,然后编码验证了这个固化的流程进行推进,防止 edent 进行一些自由发发挥,然后也保证生成结果的一个稳定性, 嗯, ok, 然后文件好,我这边我觉得主要是两两部分吧,因为呃 agent 承载工作流,承载经验跟工作流的话,我觉得主要就是呃模型与 与外部的几个交互。第一块呢,就是说不管我们提供这种 skill 也好,还是说 promote 也好, 其实呢本身就是我们固化的一个流程,或者说我们把我们在调试调优领域的一些经验做总结以后,通过这种呃跟 agent 交互的形式,把, 把通过这种 md 的 形式给到 agent。 另外一种呢,就是我们其实工具里面本身就会承载很多的呃这种调试调优的经验,那 agent 会通过 mcp 去调这种 function call 的 能力来执行,所以呢,我觉得主要就是这两块,嗯, ok, 好 的, 对,然后刚才的话就是我们还有还有三位专家其实一起讨论了 agent 的 一些发展趋势上面的一个话题, 然后其实我也了解到,然后咱们上海人工智能实验室,然后这边在 a 证的方面有了一些这种研究的一些成果,那么接下来的话就请赵老师然后给大家分享一下。好,赵老师你来行。好, 嗯,首先感谢华为提供这么一个平台,然后我在这里为大家分享一下我们实验室的一个最新的成果, 也就是说我们标题呃企为进化之光,也就是我们是基于进化算法然后构建的一个智能体,它能够自动的生成大模型的算子, 而且是具备生产环境可以直接使用的,基本上就完全呃可以取代,就是在大部分场景下可以取代这个人类专家的介入,可以直接生成, ok, 呃,首先介绍一下这个算子开发的现状吧。呃,因为我们是从使用者的角度来看待这个国内这个算子开发的现状,也就是说那芯片有多种多样,有 d、 s、 a 这种架构,有多种这种 呃架构形式,那各种呃架构都有特定的编程范式是吧?大家如果了解算子开发的人大概都知道这种那个编程范式,那所以呃对于这个这种 呃现状来说,那开发门槛是比较高的,那调优难度如果能写出那个就是性能属属于天花板级的这种算子,然后也是比较高的。 另外呢,在还有一点就是在一个厂商内部,它多个芯片待机之间也存在这种架构不兼容的这种问题,所以说,呃,针对这种现状,我们就开发了这么一个能够这个自动生成算子的这种叫做 konsole 的 这么一个系统。 ok, 那 使用大模型生成算子这个问题怎么定义呢?这个其实也很简单,呃,我们只要把需求告诉大模型,比如用自然语言来描述呃这个算子的需求,或者是你可以用拍套式代码来组合 呃这种乃异物的实现来,先把这个计算流程描述清楚,然后把这个东西交给大模型,之后大模型就可以生成一段代码,无论它大模型是能够生成一段代码的, 那后面就是评估精度,评估性能,这不是一个简单的这么一个那个问题定义, 那我们就呃前期,呃确实在之前,呃可以这样交给大模型,大模型生成一段还可以的代码,然后我们人类专家再可以基于这一版代码进行修改一下,确实可以提高一些那个开发的效率。但是后后面我们想让 我们更贪心,我们想让大模型做更多的工作,那大模型是不是能够直接就生成我们生产级可用的这种算子代码呢?所以说我们基于此构建了一个 control swift 的 这么一个系统,那这个系统是引入了一个进化算法, 所谓进化算法就是呃之前那种传统的进化算法是一样的这种思路,它内部有多个岛屿, 然后多个岛屿之间是进行独立的,这种进化也就是一轮一轮的进化,一轮一轮的调用大模型,让每个若干代在进,在进行岛屿之间这个精英个体的一个迁移,增强一个全体的搜索能力。 那呃在这个进化引擎内部还维护了一个精英档案,这个精英档案是呃,比如进化的当前阶段每一种,因为每一种算子代码它有一个结构,然后把这个结构抽象为特征,然后就可以形成一个网格化的档案。在这种呃代码结构这种特征下, 它的这个最好的性能是哪一个?然后呃使用精英档案可以保持这个解空间的一个多样化, 那评估引擎肯定也是必备的。也就是说呃大模型生成的算子,我们要对他进行评估,然后让他给出一些优化建议,然后这样循环的再次调用大模型,进行一轮一轮的迭代,一轮一轮的进化, 然后最后就输出的这个算子代码,我们就发现他呃可以呢达到很好的这种性能。 所以我们这个 ctrl swift 是 从代码生成到自动优化,它整个模拟了这个生物进化论,就实现了呃自我的这种编程革命,就开启了这种 ai 为 ai 写代码的这种全新时代, 因为它输出了这个这个进化过程中输出的这进化轨迹,我们发现它可以运用于 r l 训练来进一步增强这个大模型的这种算子代码生成的能力。 所以在后续的算子生成任务中,它这个代码大模型的能力提升了,那它就更容易来产生呃人类专家可能没有发现的这种优化的这种范式。另外它在生成的这种算子代码 代码的时候,这种优秀的算子代码,它是有这种优化的这种 pattern 在 的这种优化方法在的,我们把这优化方法 然后放到这个知识库里面,在以后的那个算子生成的任务中,他就会呃使用这个优化知识,可以使用更小的更少的轮次,然后来生成算子质量更优的代码。 所以说是大模型是负责这种呃天马行空的这种代码变异,然后进化算法来负责这种大浪淘沙式的选择,然后若干代之后,啊代码自己就达到了这种性能的天花板。 嗯,这个整介绍完整体架构之后,再呃简单介绍一下其他的这些组建,包括这个评估的智能体,因为呃在我们发现在一个算子耗时比较短的情况下,大概几十呃 呃微秒,这种情况下,呃算子测量的这种性能测量并不准,所以呃所以会开发了一些机制,然后来抑制这种测量的噪声,然后也发现大模型其实会偷懒,它可以呃也许会直接生成那个呃 这种 hack 的 方式来生成这种代码,所以我们还开发了一些静态代码分析的方式,然后还有动态运行式的分析,还有那个 ncu 路由栈的分析来对大模型生成的代码进行一个质量检验,属于这种情况。 ok, 那 呃刚才也讲到了这种 r l 后序面,也就是说大模型在这个进化过程中,也就是 control swift, 呃会输出呃一个进化轨迹,那进化轨迹自然就是一个 state action reward 这么一个 一个符合 r l 训练的这么一个素材,那这个进化轨迹用于 r l 训练,我们发现可以针对这个大模型的变身能力有很大的提升。可以看到,因为 colonel smith 是 呃我们实验室自己训练的这个模型, 呃主要用于这个算子代码生成,然后使使用这个呃呃轨迹进行 r l 训练之后,它这个大模型这个生成克诺的这种能力得到了一个很好的提升。克诺 smith 也是也是开放权重的大,欢迎大家也去那个可以试用。 嗯,呃取得了一些成果,也是,呃有一些实际的一些应用,呃,比如在公开数据集上,然后呃也取得了很好的结果。然后在比如在那个 i m deploy 推理框架里面, 呃生成了一个算子,可以使端的端呃性能提升百分之二。然后针对实验室的一些 afo science 蛋白质结构预测和分那个分子模拟这些场景的算子平均加速比可以达到四点一七倍。 呃,因为我们是做这个国产化相关, deeplink 团队整个是做国产化相关的,所以是呃,我们有两个途径来生成,呃,生,生成,呃那个生藤亲和的这种蒜子, 一个是我们直接呃直接生成,另外一个就是我们和呃生成团队来进行合作联创的一个一个另外一个 agent, 也就是说我们生成一个标准的 chongqing, 然后由这个 agent 再将标准的 chongqing 翻译成生成亲和的这种 chongqing, 所以这,这是一个这么一个代码迁移的一个工具。 ok, 呃,这个代码迁移的工具,呃不只是支持 triton, 也支持太阳能等其他的这种 dsl, 呃,它可以将呃 这种标准的这个表达,然后自动迭代,然后自动转换,转换为升腾亲和的这种那个表达形式来支持这种高效的这种迁移优化,平滑接入升腾生态。 呃,实验结果也表明这个迁移也是比较成功的。呃,这一百三十五个算子里面成功率会达到百分之百,然后平均性能也是在这里也有一个很好的一个效果。 ok, 那 client swift 在 其他场景也有一些落地,比如在为 i c 浪提供了一个,呃提了一个 pr, 呃来优化这个算子,它取得了四点七八倍的一个单算子加速,然后为 i n t d apply, 这个单算子是提升了一点三倍。 呃, client swift, 呃比较简洁,因为我们是做了一个产品,所以呃提供了一个页面, 可以直接在页面上输入呃用 top 组和算子来表达的一个呃 n e f 的 这种实现,然后呃后端可以选择升腾后端,呃就可以经过一段时间的进化,它就可以产生呃优化后的这种算子,所以,呃, 现在来表明就是这个产生这种优化后的算子基本上就可以具备生产环境,可以直接使用啊,不再需要人类专家再进行介入,当然也可以人类专家进一步分析,然后进一步调优,然后来帮助大模型生成更好的代码。 嗯, kernel swift 未来,呃会突破这种易购硬件的一个算子迁移,然后快速开发性能优化的一些技术瓶颈, 然后支撑芯片的开发,打造国产芯片的这种这种优势,然后那个突破国产 ai 芯片大规模落地的这些瓶颈,然后通过智能体开发与全电路的这种工具建设,实现开发效率与性能的这种双突破,这是我们未来的一些一些规划。 ok, 关于 control swift 我 大概就分享这么多。嗯,好的,然后那个感谢赵老师对于 control swift 的 相关的一些内容的分享。嗯,好,下面的话我们,呃就是有一些问题,然后首先的话我这边 然后看到刚刚您介绍的过程中有那个 control swift 当中,然后有一个算子生成的一个 i l 的 训练。呃,就是赵老师您能打开就是更详细的介绍一下 i l 这一块训练的一些效果吗?特别是指标方面的一些。 好,呃,刚才也介绍的 r r 训练是实现了这种 ai 为 ai 写代码的这种一个新的范式, 就是在 ctrl shift 最开始的时候,那我们可以使用一些开源模型,然后来进行算子代码的一些生成, 然后将这个算子代码生成这个轨迹保存下来,那这个轨迹中比如一代又一代的进化,那这一代就是一个 state, 然后下一代的这一个 prompt 就是 一个 reward, 然后下一代的结果 就是一个 action, 然后这么就会形成这个这个轨迹保存下来。后来我们就用于训练自己的这个模型, 训练出来的模型就发现比一些呃其他开源的开源或者 b 源的模型生成蒜子的那个质量更高,性能更好。嗯,所以这是呃 r l 训练在这个 control switch 中还是有非常发挥了非常重要的作用的。 嗯,对,是的,其实我们这边也能够看到一些其他的一些场景,其实 r l 对 于这种 a 字和端端端的训练,其实对于效果的提升还是非常明显的。 其实我们升腾这边目前的话也正在研究更通用的 agent 这样一个 inforce 框架,通,就是我们也是希望通过这种后训练的这种范式能够提升垂钓 agent 的 一些效果。好的,然后冯腾,你这边还有没有一些问题可以和赵老师交流啊?赵老师, kindle swift 目前是只支持 triton 吗? 因为 triton 是 一个呃 high level 相对友好的这种一种一种语言。呃, 我们是先在传递上做了一个这么样的一个系统,然后结果也比较好。另外呢,我们也在探索,然后来支持比如 a c, n c 这种语言来描述的这种算子,但是呃用 a c, n c 的 这个复杂度比较高 一些 a, c, n c 写的算子,然后华为的专家也比较的厉害,然后把一些算子也 这个优化的方式也是非常的好。那我们现在的一个进展就是我们可以生成 a c 的 这种算子代码,但是我们生成算子的代码的性能 比呃华为专家开发的这种算子性能还是有一定的差距,这一块我们也期待和华为能够呃共同合作,然后来提升这个算子的性能。 目前升腾其实也在做一些那个算子自动生成的一些探索,呃,我们推出了那个 cambote, 里面其实沉沉淀了很多呃专家对于算子调优的一些经验,呃,目前我们是支持 sony 还有 triton 它浪等一些编程语言的算子生成。 好的,然后再次感谢赵老师的一个精彩分享。呃,下面的话就由我然后给大家介绍一下升腾 a 正题课 ai 的 相关的一些全景的一些解读。 呃,首先,然后本次直播的话,然后由我和剩下的两位专家,然后给呃给各位开发者,然后带来了三个关键能力。 然后第一个是呃基础技能库这一块儿,然后我们给了一个这个 cambot 啊, cambot 的 话,它内部提供了非常多的非常丰富的一些升腾算子开发的一些 skill, 然后支持开发者能够快速地集成使用。 然后还有一块儿的话,就是中间这一块儿,然后有一个呃 a 帧 tik 的 一个讯推调优化框架,然后提供一个端到端的 a 帧后训练框架,然后这个框架 能够直接对于垂域的 agent 应用,然后进行端到端的后训练,呃优化的一些调优,然后提升垂域任务的成功率,然后加速 agent 能够在我们垂域场景下快速地做一个落地。 然后还有一块的话,就是最上面这一层,然后在 agent 垂域呃典型应用案例当中,然后我们给了一个 manage studio agent, 然后这个 agent 然后它包括了像智能问答,像性能调优,不仅局限在这两个方面,还有更多的一些极简应用、高效应用的一些 agent 应用实践, 然后这个这一些 agent 然后能够方便开发者,然后在生成上面进行适配和调优优化。 好的,然后下面的话,呃,由我快速给大家介绍一下。我们这个呃 aura 就是 agent 一个 i l 虚拟条优化框架, 然后首先这个框架,然后它的定位其实呃北向的,然后它呃支持适配,呃很多的这一些 agent 的 一些这种开发框架,然后能够把一些这种垂域典型的应用,然后接入到这样一个 啊 agent 就是 训练的一个系统里面来,然后它的下面其实也是呃使用了我们升腾的一些这种大模型训练推理的一些这种后端运行。这里面包括像 vm 蜂的,包括 s g 浪, 包括训练里面的有一些 max speed、 r l 啦,包括 v e l 等等的这一些这种经典的一些这种大模型训练的一些框架, 然后我们这个框架,然后在中间,然后提供了啊两大块的就是一些特性。第一块的话我们跟它叫基础特性, 这一块包括像 agent 服务的一个接入管理,包括这种讯推权重同步的一些这种管理,还有就是 agent 整个多轮长城的这种轨迹上下文记忆的一个管理,还有就是呃任务调度编排上面的一些管理, 然后除了这一个基础特性之外,然后我们还有一些这种高阶的呃一些特性, 这里面典型的有呃同步共卡的,包括这种异步迅推分离式的这些特性,还有就是呃像支持一些经典的 on policy 的 一些 rl 的 一些训练的一些 agent 算法, 还有的话就是针对大模型的这一个呃训练的一些呃 robert 加速这一块,其实我们这一边也沉淀了一些像混合批次调度一些相关的一些算法能力。 然后还有额外的一块是我们现在呃正在开发中,马上就可以呃,让开发者看到的是这种垂玉的微调数据合成相关的一些这种能力,包括一些这种呃算子生成类的这种垂玉的一些数据集。 对,然后这一块的话是我们整个二 r 框架的一些这种核心的特性,然后我们还有一个呃比较明显的一些这种优势,就是我们对于开源生态的这种兼容的油耗,然后我们南北向的这种节藕支持主流的这种 呃开源的啊训练推理框架,然后与 a 正科开发部署框架,然后我们这个框架提供的是 a 正科端道端训练的一些加速,还有在这种多轮超长上下文训练的稳定收敛相关的能力。 哎,听着这个训推框架,这个 l 这个框架很很可以啊,然后因为我们也是有很多上层的 这种需求,不知道这个后续的 excel 框架是否会开源,还有什么计划?嗯嗯,对。然后我们这个 ror 的 话,我们这个迅推调的一个优化框架,其实现在 prebel 的 版本的话已经开源了 啊,未来的话我们也会有更多的一些特性的一些规划,包括路由 mac。 接下来会讲到,然后我们已经进行持续的这些特性的迭代,未来的话我们会全面开源, 同时的话也欢迎呃咱们这个浦江实验室的赵老师这个团队未来能够在咱们这个升腾二 r 这个优化框架之上,然后进行一些呃,咱们算的升腾了,或者说其他的更通用场景的后续量的一些调优, 好好的。然后下面的话,呃,我们也有请另外两位升腾的专家,然后我们先让这个呃冯桐,然后介绍一下这个 cambod 好, 冯桐 好。呃, camote 的 话主要是为了提升呃看算子开发效率,然后提供了一系列的智能体, 然后目前的话 camote 是 支持多种算子编程能力,然后包括 ac, 然后 kataus 的 模板库 tray, 呃 tullon, 包括拍 pto 这些都是支持的。然后它整体是覆盖了呃整个的算子开发群流程,包括一个环境的配置, 呃算子的设计代码实现,然后算子测试,包括最后的文档编辑,然后整体它。呃呃安装也特别的方便,采用那个 plugin 方式安装,即插即用,只需要单条命令就可以安装完成。 欸, kano swift 和 cambote 好 像在这种功能上都是会生成算子, 那 kano swift 我 们是采用了这种进化的算法,然后比如用呃 elix 这种算法维持进行档案,然后有多岛屿的模型,然后也有一些知识点。呃,不知道 cambote 这边对于这种进化算法有没有一些考虑过? 呃 camote 的 话目前主要还是基于我们呃算子的专家经验,然后沉淀的一些 skill, 但是我们同时也在进行呃基于一些迭代进化的一些尝试,呃,后面我们也可以借鉴 kano swift 的 一些成功的经验。 然后 camot 的 话,它现在整体架构是一个分层结构啊,组合编排,然后是为了适配多场景的一个开发。在最底层的话是 skill 的 一个知识能力层,然后这这层包括一些原子的 skill, 包括一些那个 n, p, o 架构, 呃,整一些 skill, 然后他林设计的算子,他林设计的一些 skill, 然后还有呃圣 c, 然后包括 tritone, 他 还浪一些 api 最佳实践的一些 skill, 呃,还包含精度,然后运行时调试,然后性能验证的一些 skill, 然后电。中间层的话是 sub 二级的层, 呃,我们定义为角色的一个执行层,然后它包含,呃方案设计的 subtitle, 然后代码开发的 subtitle, 然后代码简式和性能调优的 subtitle。 最顶层的话,呃,我们定义的是应用编排层, 呃,这层主要提供就是下面呃中间层的一个角色的一个编排, 整个算子开发流程的一个编排。然后最顶层我们现在提供了 eson c control 直调的一个开发流程,然后 eson c 这另一算子也就 s, l, n 的, 呃开发流程,然后还有 triton, 呃, pi p, t, o, 呃,包括 kata labs 的 一个整体的一个算子的开发流程, 呃,这个是算子的一个整体的啊。 combo 一个整体的架构,呃,现在给大家演示一下,就是 combo 的 一个使用的呃过程, 它会先进行一个那个环境的检查,然后设计 event, 会进行一个算子的设计,然后设算子设计完成后会和开发 event 进行一个呃串讲,然后交流,就是 呃一起来交叉验证设计中存在的问题,然后进行相应的一个修改,然后修改完毕后,开发 event 会进行算子代码的一个生成, 扇子代码生成完成之后呢,我们还会有一个代码显示的一个 agent, 然后去检测代码,如果代码中存在一些问题,然后会返回给开发 agent 进行相应的一个修改, 然后最终扇子开发完成,然后编辑,嗯,编辑通过后会进行一个那个性能和精度的一个测试,测试完成后,然后会最终输出一个呃, 整体的一个报告,开发的报告啊,这个就是整个 camot 的 一个开发的流程。嗯, 好的,然后感谢冯腾的介绍。然后下面的话请这个文杰,然后给大家介绍一下咱们 man studio agent 相关的一些这种加固解读,还有实操的一个演示。好,我来为大家解介绍一下深腾的 man studio agent。 首先 man studio agent 是 一个非常好的宅体, msu agent 的 应用场景呢,主要是分两大块,第一块呢,就是说我们针对特定的一些开发流程,比如说,呃,可能在做训练开发或者做推理开发的时候,我们会涉及到一些精度调试,性能调优,模型量化的一些过程, 然后呢,这期间呢,可能会有一些算子的优化,或者算子开发的一些工作,这是一些单点的流程。然后另外一块呢,就是说我们会涉及到一些端到端的迁移,比如说我们从 hackinface 上下的一些模型,怎么在生成上端到端的跑起来, 这是主要的一个应用场景。另外呢, agent 本身其实就是一个协调的系统,它需要 知识库,然后基础设施还有资源的工程管理来做一起协同。所以我们整个 agent 呢,在上半部分呢,我们会以这种功能性的 sub agent 的 形式来提供。 然后呢资源管理这里会,对啊,我们能够接入的这种 l a m 的 api, 然后 agent m c p 等等去做管理。 知识库这里呢,我们会沉淀我们在深层上的一些调试调优的一些经验,以及我们在算子开发上的一些经验。然后基础设施这里呢,就是我们原来 m c d 构筑的一些啊,工具化的能力,这些呢,也可以不管是作为啊 m c p 化去调用,还是说能直接在 在那个 agent 里面去去调用,然后里面呢有一些我们承载的一些知识库都可以去给 agent 做使用。 然后右边这个图呢,我们从现状来讲,可能更多的用户都是一步一步地手动地去执行。那有了 agent 以后呢,我们其实是希望 agent 能够自动地去做这种流程化的编排,能明确比如说第一步应该干什么 上来,比如说我们要先去做一下模型的一个设计,我怎么去做这个啊,变形的一个策略,或者说我怎么样去部署。然后第二步呢,去做我们的设备开发,比如说我们这里可能会涉及到算子的调试调优,做模型的量化,投机推理的模型的开发等等。然后呢再进行调试调优, 我们希望说 agent 这个 m master agent 能够调用它自己的 sub agent, 能把这一步一步的流程全部给自动化串接下来啊,下面呢,我将通过一个呃量化的例子给大家简单介绍一下 master agent 是 怎么去运作的啊? 这里呢,我们先启动了量化的这个 agent, 然后呢告诉 agent 我 们需要做的事情就是调一个千万三三十二 b 的 模型,然后去做量化啊,精度损失呢要求是小于百分之一。 然后 agent 呢,它开始去思考做流程的一个编排,主要目前识别到它需要做两个阶段,第一阶段呢就是去做推理模型的适配。第二阶段呢就是去做量化的一个迭代。 推理模型的适配呢,主要是因为我们会涉及到一些新的结构,新的模型,所以呢我们会在里面会因为要做离群值的抑制啊等等的一些适配工作。 然后第二块呢,又分了三个迭代,就是三呃阶段二,又分了三个迭代,分别是进行方案的设计,怎么去做量化。 然后第二块呢就是模型具体的量化的一个过程。第三块呢就是去做测评,我们量化出来的结果,它最后的在数据集上的精度的表现是怎么样子的, 这些都是 agent 自己去主动执行,然后呢一步一步的去结,根据结果去做反馈, 我们可以看到它现在已经在阶段二的第三个迭代的部分了,在做精度的测评。 好,精度测评完了以后呢,他其实发现现在第一轮迭代完,就是精度是没有符合我们的目标的,所以呢他又开启了这个循环的过程,就是说继续去做方案的设计,量化跟测评的一个过程, 直到说要么达到我们的退出条件为止,或者说达到了目标为止。 然后这里呢,我们其实也是在量化里面呢,也是分了三个 sub agent 去执行的,就包括这种工具的 agent, 测评的 agent, 以及我们量化的这个专家的 agent, 就是 让每一个 agent 能够更加专注于自己的一个领域啊,避免这种多 skill 的 加载或者多 m c p 的 加载,能把它的这个呃上下文啊, 那个用完。然后呢?所以可以看到结果啊,最终三次三轮迭代完,最终的结果他是找到了一个最优的一个结果啊,精度已经达标了,就是这样一个案例给大家分享一下。 哎,这里有一个关键的问题啊,就是比如我们人类在做这个,比如说算子开发吧,我们会借用一些工具,然后比如来看指定流水图啊, 然后来看库布利用率, back 利用率,然后来判断这个算子还有没有优化空间,或者是下一步的一个优化方向。那我们 ctrl shift 在 做的时候,呃,也是,呃,因为工具 只能比如扇子流水图只能依赖于人类来分析,所以能给大模型的这种优化建议有限,不知道你们这边呃能不能就是会不会提供一些对大模型比较友好的这种优化方向的一些建议? 嗯,好的,赵老师。因为其实 madison studio 本身就是在做这种调优的建议,或者说我们期望说 aj 能干的事情,一个呢是自动化的,能够去帮我们去做一定的调优。另外呢就是说如果说自动化 不能完全自动化去优化的部分,我们也希望他能给出一些建议啊。这个我们在后面的 road map 里面可以去详细介绍一下。 嗯,好好的。然后呃,前面的话就是我们三位生成的专家已经介绍了各自的一些能力,然后下面的话我们也介绍一下,呃各自能力的一些这种规划 roadmap 相关的一些内容。 好的,然后下面请这个文件给我们介绍 marsuud 的 一些论文案。嗯,好,我们 marsuud agent 的 话在我们 q 二阶段呢,目前主要还是聚焦于原子能力的构建,就是因为我们本身其实 marsududu 有 很多这种啊, 已经已经成型的工具,那么我们会把它做 a 卷的话,能让它解决,比如说像模型刚才端到端的一个量化的一个能力啊,不需要人工去介入。另外还有一些像刚才赵老师提到的算子性能的一个采集分析,然后还有模型性能的一些优化建议,精度溢出精度的问题诊断等等。 然后在 q 三呢,我们会更多的去聚焦场景化的能力,主要是面向开箱场景,我们能去做一些并行策略的询优,然后以及提供开箱性能的一个优化跟建议。 然后 q 四呢,我们会继续去扩充场景化的能力,主要针对一些特别疑难的精度性能的定位的一些问题。 主要是像包括像刚才提到的,我们如果强化学习的精度有问题了,那我们怎么去结合 agent 能够把它快速定位?另外呢可能还有一些在长稳性能的抖动的问这个问题,我们目前也是希望 agent 能够发力,能去帮我们做快速提效的啊。嗯,好的。 然后,哎,冯桐,你这边对于 cambote 这一块有没有一些规划可以给大家讲一下。嗯,呃, cambote 的 话,今年后面主要是还是针对呃算子生成能力呃的提升的一些目标。然后 q 二的话我们 是支持 vector 类算子的一个生成,然后生成的算子性能达到零点六倍的手写。然后 q 三的话主要是做 cv 融合呃,包括 amount more, quantum more, 然后 attention 类的一些融合算子的一个生成,然后生成算子性能可以达到零点六倍的手写性能, 然后到 q 四,呃全年的目标就是要支撑全量算子的一个生成,然后最终生成算子的性能达到零点八倍的手写算子。嗯, ok, 好的。然后下面的话我这边然后介绍一下 aura 我 们这个迅推叉框架的一些就关键一些里程碑信息 啊。目前的话我们已经有了这个 preview 这个版本,这个版本的话已经具备了像 all policy 的 一个迅推共卡的这样一些特性,包括迅推分离的一些特性,以及一些这种混合皮脂调度的这种加速的一些特性。 然后在今年的 q 二,我们这边也规划了异步的 one step of policy 这样一个呃高阶的一个算法的一个支持。然后我们这边同步也规划了两个实验性质的特性,这边有黑盒的 a 政策接入,包括这一个 m o e 类模型的这一个路由的重放等等的一些这种特性。 然后在今年的下半年,然后我们这边也重点规划了像这个 farthink 权益部的这个噢 policy 的 相关的一些算法,特别是怎么样把这个精度做一些这种对齐,还有的话也支持这个 prefix r l 的 这一些呃树状的这种前缀的加速的一些算法,以及这种融合树搜索的 一些 r l 算法,还有就是我们这边也规划支持多模态 a 帧的一些 r l 算法,还有就是我们这边也规划支持多模态 a 帧的一些 a r 算法,还有就是我们这边也规划支持多模态 a 帧的一些 a r 算法,还有就是我们的这个 h e。 然后我们这边也会针对呃升腾的一些这种呃,就是不管是九五零还是我们现在呃已经发布的一些这种呃升腾的一些这种易购的一个算力,然后我们能够支持一个低比特的这个 i l 的 一个训练, 以及还有就是我们这边也规划了就是支持一个呃自吸梳投机的这样一个呃方法,也能够加速这个 a 证和 i l 的 这样一个训练。 然后下面的话我们也给了一个 alpha 框架的这样一个 gitcode 的 一个链,一个链接,然后也欢迎各位开发者然后访问这个开源代码方下载使用, 然后在使用过程中的话,如果遇到一些问题,还有一些新的一些特性需求,也欢迎随时提一束,然后在社区里面我们进行一个快速的一个反馈,一个交流。 好的,然后今天的呃我们这个几位专家的分享啊,就先到这里,下面的话我们进入这个自由互动的一个时间,然后线上的这个观众,然后有任何的想要交流的一些问题,都可以直接打到公屏上面,然后与线上的我们这些专家进行一个探讨交流。好的, ok, 咱们现在已经打上来了,是不是? 行?然后这边有第一个问题,然后呃,新手用 camot 开发算子,需要提前掌握很深的看的一些底层知识吗?还是跟着这个步,然后直接就可以上手? 哎,冯同,你这边给那个这位朋友,然后解释一下。嗯,呃, camot 使用 camot 的 话不需要掌握看的底层的一些知识,然后 camot 包含整个的算子的开发流程,包括呃你环境的安装,这个都是有对应的 skill 去完成, 就是新手也不需要去呃管理这个环境,安装这些这些事情,整体的话都是由 cambod 来完成的。然后 呃, cambod 的 安装的话,也是提供了插电式的安装方法,然后现在目前已经适配了像主流的呃, open code, 呃 tree 啊,然后 costo 这些,呃主流的一些开发的工具,然后可以直接使用,然后 呃,呃,对于算子的生成的话,你只需要输入呃自然语言的一些算子算法的一些描述,然后或者就是算子的一些公式,呃,或者提供比如说 touch 实现的一些那个精度标杆,然后 给到 cambot, 然后它就会对生成对应的一个算子,并最后进行一些精度啊性能的一些验证,然后呃, 呃,在 cambote 社区上,呃,有一我们也提供了 canlab, 就是 云上的一些开发的环境,开发者可以免费的去试用。 嗯,好的,然后我们看一下下一个问题。 好,然后这个问题是,呃架构当中,然后 m, a, p, e, l, s, 然后算法与岛屿模型,然后分别解决了什么样的问题,然后两者是,呃如何配合工作的? 哎。那个赵老师 ok, 嗯, ok。 这个是 kano swift 这个系统中一个核心的一个模块啊, 就是这个净化引擎内部,呃是分为多个岛屿的,然后多个岛屿进行一个独立的这种净化,然后定期再将岛屿之间做一个精英的一个交互,这样子是为了提高这个,呃, 这个,呃进化的这么一个效率,然后能够更更更高的,更快的来得到这个最优的这种个体。然后 mapys 是 一个精英档案,它回答了智能体是需要一份覆盖所有可能性 的一个地图,也就是说这个档案它是一个。如果以二维的方式来呃来比喻的话,它是一个网格嘛,也就是说每一个坐标就代表它生成的这个算子的这种特征下,呃,这个网格里面最优的这么一个个体, 那在多轮进化以后,这个网格会被填满。在这种架构下,这种代码结构下具有的个体是这样子,在另一种那个代码结构下具有的个体是那样子,这样对环境不确定性和任务多模态,这种呢就是会会这个很好的一个适应性, 所以说两者配合实现了这种规模化,然后易购化,然后鲁棒化的一个质量,一个多样化的一个生成, 主要是为了解决这种从单一的最优策略来迈向这种情景的自适应的这种策略所需要的一个核心的这个技术组合,也是我们 control swift 的 一个核心的一个一个技术点,大概是这样子,嗯, ok, 哎,我们再看一下其他的一些问题,好,然后这边有一个线上的观众问到,然后在升腾平台上面,然后进行 a、 n、 t、 i l 的 训练调优,然后现在都有哪些优势? 呃,对,然后这个问题的话,然后我就来回答一下。就首先的话就是呃 agent 一个 r l 这个场景,其实它是有很多这种特点的,包括像这种多轮交互,然后长城,然后就是上下文长度比较长,然后与工具之间进行一些这种动态的一个交互等等。这些特点。 其实我们这个 o r 的 这个开源大模型,以及典型的这个 agent 垂云应用的一些呃案例。 然后例如像我们比较常见的 third 类 agent, 包括 coding agent 以及这种运维场景的一些这种 agent, 其实这些 agent 在 我们这个二二框架上面都是经过实战验证的,然后我们能够做到一个开箱即用,方便易用,然后也可以减少大家,然后在训练过程中少踩一些坑。 当然针对这个升腾的这个翻底底座,包括这个特性,其实我们也做了一些这种呃调度性能上面的一些这种优化,我们也能够大幅缩短训练一个端到端的一个时长。同时其实我们在精度这一块也做了对齐验证,确保在整个训练过程中长稳稳定收敛 啊。后面的话,其实我刚才的材料里面其实也讲到后续的我们这个二二框架将会重点围绕着异步 of policy 以及低精度的这一些低比特的这种啊,易购的这种训练,以及投机推理的一些这种加速 啊等等的这一些,最终能够提升 agent 应用开发工程师还有咱们开发者的工作的一个效率。对,嗯,好的,我们再看一下其他的一些线上的一些问题。 好,对,然后这边有一个问题是 agent 生成代码的稳定性如何保障?呃,如果生成的代码存在呃语法或者性能不达标,那么接下来之后应该怎么处理呢?呃,这个我看一下是不是呃文结你这边,嗯, 这个要不赵老师可以啊,回答吧,哈哈,可以可以。呃,在我们 control swift 在 进行这种若干轮的这种进化的过程中啊,确实会 呃存在这种 agent 生成的代码什么稳定性的问题啊?然后还有错误,语法问题,性能不达标的这种问题都都会存在,因为不可能一下子就能够生成呃最优的结果,所以这是也是一个实践的一个一个 呃实践出来的一个结果。所以我们在呃,我们只能尽最大的努力,让 agent 每一轮迭的过程中 呃都会产生一个最好的结果,但不能说完全保障,然后在最后呃整个进化到最后,然后再选取一个呃精度肯定是达标,然后性能最好的这么一个个体。嗯,那在这个呃每一代进化过程中具体是怎么保障的呢?有有有多个方面吧。 一个方面是一个代码稳定性的问题,也就是说在单轮进化的过程中,我们会呃告诉他这一个 呃 api 的 一个使用方式,不让他自己自由发挥去猜测这个 api 的 使用方式,而是从我们的知识库里面来查找这个 api 的 输入应该是什么,输出应该是什么,根据我们的这个所所谓的一个手册来进行一个编程,而不是自由开发。 第二个是那个事后的一个反馈,也就是说他生成了这种蛋吧,然后我们拿去翻译的时候发现有翻译错误,那翻译错误信息再反馈给大模型让他去改,然后修正这个翻译的错误。 ok, 这是这是这两点,那性能不达标的问题就只能是呃呃有有多,也也是有多个方面吧。一个是 我们会有一些优化的 pattern, 比如我们现在生成的那个任务有呃有上千个任务,然后在呃 已经生成了有上千个算子,然后在这样生成的过程中,呃每一轮的一个优化的一个一个会沉淀下来,刚才讲到优化的这个优化经验或者优化 pattern 会沉淀下来,作为下一轮呃以后后续算子优化任务的一个一个一个鲜鲜艳知识, 那后续他会先读这个知识库里面相应的知识,然后这样子来保证后面的任务,然后能以较快的这种方式,就是较少的这种进化轮次来达到一个呃较好的效果。 大概是这样的。哦,我接着赵老师的再补充一下,就是说因为刚才也问到,就是说比如生成的代码存在语法错误或者性能不达标吗?因为其实刚才赵老师介绍的时候也有一点,就是我们也可以分布走,比如说我可以先自动生成一个 啊,可能功能或者精度性能没有那么完美的一个算子,然后呢我再用 agent 再继续去对它做啊进一步的优化。然后呢这里我们就像刚才说的,它其实是一个反馈闭环的一个机制,就是说比如说我们希望它的性能达到一个什么样的水平, 然后呢它不断地去寻找,不管是做胎龄也好,还是说怎么样去优化它的一个啊,算子的一个啊,搬运跟它的一个计算的一个逻辑啊, 来使它这个最终的一个性能能够向着我们预设的这个目标去走啊。所以它其实也是一个 agent 的 一个能够自动化的一个过程啊。嗯, ok, 好 的。然后我们再看一下其他的一个问题。 好的。然后这个问题是,呃作为新人能不能直接雇用老员工用 agent 沉淀下来的工作流,呃,这样是不是就能少踩很多坑? 呃,这块儿应该和 scale 有 一些关联性,呃要不相同,呃。对。其实我们目前做的些工作就是,呃就是像这个问题所描述的一样,就是把专家的一些那个经验,然后像算子开发的一些调优一些经验,然后沉淀成 scale, 然后呃,呃供那个让大模型去更更加的了解,然后生成的一个算子的开发,然后后面如果新手直接使用这个 skill, 然后用 agent 就 可以生成一个相当来说性能呃比较好的一个算子。 嗯,对。其实我觉得它可能不只是老员工的这个经验沉淀,对吧?因为我们在网上其实也能看到很多的 skill。 对 这些 skill 呢,一方面就可以大家可以直接拿来做使用。 另外呢我觉得可能随着将来模型的一些发展,我们现在在网上的这些 skill, 嗯,都有可能成为现在的就后续发展的这些模型的语料,嗯,有可能它直接就沉淀到模型本身里面去了。是的,它会内置到模型的一个知识里面。对, 呃包括,呃像我们自进化过程中,然后模型一些比较生成比较好的一些算子,它那个,呃它的一些总结,这部分其实也是可以沉淀成 skill 的, 然后对后续的一个算子的生成,呃效果会有所帮助。 对,其实刚刚那个问题的话,其实我也突然想到了,其实这个呃 scale 其实本身其实现在也有一些最新的一些技术在搞这个 scale i l, 呃,期待的话,其实后面的话,我们这个二 r 这个框架未来是不是也能够支持更多的这一些 scale i l 上面的一些能力? ok, 然后我们再看下一个问题,对,刚才那个问题是不是挺好的?对,就这个这一块应该是 uh 原子弹当中的两个组件,对不对? 我看一下,呃,这个是 come, 哦, come 是 吧?对对对。然后这个问题的话是应该是 performance 的 tuner, 包括 tester 这个 agent 能够帮我们优化到什么程度? 比如能够推理速度能够提升多少?有没有一些对比数据?好,那就请鹏鹏为大家做一个分享。嗯,这个的话像,呃经过调优之后的升腾的 vector 类一些算算子,呃目前的话是可以达到呃零点六,然后到一点零倍的一个手写的性能,然后 呃比如说针对一个特定的一个模型场景的一个 shape, 然后目前的生成效果,呃还是比较好的,呃,有些还是,有些甚至可以达到手写超越手写的极限。但是整体的话, 呃泛化性能,这个其实是一个比较大的一个挑战,就是多种 shape, 我, 呃同时性能都比较好,这种目前来说,呃还我们还在解决中。 嗯啊,不过针对特定的一个算子那个模型的一个 app 的 场景啊,目前来看的话已经达到一个可用的一个程度。 ok, 好 呀,然后现在这个线上问题是针对这个升腾 npu 的 一个硬件特性,这次的升级是在这个底层算子融合和分布式通信上做了哪一些的这个,呃性能的优化,从而支撑这个 a 阵上能够高效的一个运行。 呃,看这一块是不是是和算子这一块的吗?包括通信算子相关的。 呃,这个我觉得是这样子啊,大家也可以关注一下明天正式要开始的这个 kdc 啊,那上面会对,呃,比如说我们升级的分布式通信或者扇子的一些优化去做更详细的一个介绍。 可以啊,那就在咱们这个直播上就不限剧透了,我们再看下一个问题。好,然后如果缺乏哈密斯的一个约束,可能会带来一些怎样的一些潜在风险? 看一下这个问题,要不文杰你继续给大家做一个分享?好,好,呃,因为我们都知道 agent 它其实的核心价值更多是在它的一个呃自主的一个执执行能力, 那么哈尼斯的约束呢?其实就是让这种执行不会失控,或者说能够在我们的一个约束掌控范围之内啊。然后哈尼斯做了几个约束的机制吧,主要是我主要是可能几块吧 一块,就是他会有一些啊状态的管理,比如说我们避免一些重复的状态的一些执行,然后呢还有一些像权限的一些约束,比如说他能干哪些事情,哪些不能是超过他的一个权限, 然后呢还有一些去做这种啊流程性的叫验也好,或者说他最后的一个反那个 反馈的一个纠篇也好,就这些都是属于哈尼斯的一个约束的一个机制里面。我认为啊,然后如果说,呃没有这些约束,那么比如说我们没有状态的管理,或者说没有这种权限的约束,我觉得一方面会导致有一些呃状态是 它没法被记住以后会去重复的执行,有可能它会陷入到一些死循环里面去,然后呢会不断地去占用我们的资源,一方面是系统性的资源,比如说像我们的 cpu 啊,内存啊,另外呢就是会导致我们的 token 消耗的非常快啊。 然后呢另外比如说没有权限的约束,那么这里可能会导致一些比较危险的一些知心的行为,比如说我们系统上的一些文件会被删除、误删等等啊,这些行为对系统的伤害是不可控的啊。然后呢还有一些就是说 会导致一些啊行为跟我们目标的其实是啊偏离的他执行者,执行者可能不按我们的指令遵从去执行,然后呢会发生一些一些不可预测的行为,到最后呢我们去回过头去看模型到底执行了什么的时候呢?也可能说 没有办法去做具体的一个审计了啊,我觉得可能主要就这些吧。嗯,好的。呃,然后线上的伙伴还提供了 呃另外的问题,对,然后这一块是 a c n t r l 框架这一块,然后呃现在的话提供了一个 a c n t r l 这样一个框架,然后在其他的一些能力,特别是合成数据这一块,我们有没有一些方案? 呃,对,然后这一块的话,其实做这个大冒险,包括 a、 c、 n、 t、 r、 l 整个的这个训练这个过程当中,其实这个数据其实是非常非常重要的,然后我们其实也发现了这一块的一些这种需求。 然后特别的话,其实我在我的材料里面其实也提到了一块有一个叫垂玉呃轨迹数据合成的这样一个工具啊,这个工具就提供的就是训练数据的一个构建 啊。我们规划了这一部分的呃数据合成的方案,这里面包括了呃有一个 agent, 一个 rag 的, 然后这样一个复杂多条数据的这样一个数据集。 其实这一块的话我们是正在过程中,然后未来的话应该在呃几个月之内,然后去开发者朋友们就可以看到这个特性。其实我们现在还给了另外一个。呃,在我们蜂的社区里面有一个蜂的 c 算子生成的这样一个微调数据集,就大家可以访问我们的 kto 的 这个社区,其实可以找到这个数据集。 然后未来的话就是这一些数据集,包括一些合成的方案,我们都将以开源的形式提供给开发者,然后希望开发者能够通过 fft, 包括 i、 l 等后续量的方式能够端到端的提升。呃,我们的这样一个呃训,就是应用效果的一个性能,嗯, ok, 我 们再来看下一个问题。 ok, 然后这边是在 a 阵体的升级过程中,为了打破这一个单体大模型的这样一个性能的瓶颈, 我们这个底层框架上面如何设计多智能体之间的一个协调,实现真正的这样一个智能高效?是否引入像 autot 阵啦,包括 mate, gbt 等等的这种分布式任务的一个编码能力? 呃,看一下这一块儿是不是更偏向啊 agent 的 一个架构,特别是 marty agent 这一块儿, 哎,我记得文杰是不是在咱们 studio 就 marty studio agent 里面是有这样一个设计的一些架构元素在里面的,呃,你可以给这个可以简单分享一下。嗯,可以简单分享一下,就是说, 呃,因为在后续,比如说我们其实会面临像现在的大圆模型,它的上下纹长度是比较有限制的。嗯,那不管是如果说只有一个智能体,我们把所有的 skill 跟 mcp 喂给这个智能体的话,经常会产生这种,比如说不管是幻觉也好,还是说 错误的调用跟错误的一个啊指令遵从啊。所以呢,我们会设计这种多 agent 的 一个协同,嗯,让 本身的主任务有一个主 agent, 嗯,这个主 agent 呢,他可能干的更多的是一个路由或者分发的一个 agent。 其实呢,这个有点像我们呃大源模型里面的这个 me, 就是 让专家 呃,让那个路由专家去专注于自己的一个,呃,就是领域啊,我所以我们可以把 sub agent 让他能够更专注于某一个领域,为给他的 skill 或者说他的一个工具调用都是 这个纯域的。然后呢,这个路由的 agent 呢,它会去因为本身就是渐进式的去读取这些啊, reference 也好,或者说 skill 也好,所以呢,让这个路由的 agent 它去跟底下的 sub agent 去做通信,然后 sub agent 呢去记录它本 领域的一些上下文,而 agent 那 这个主 agent 本身呢?它只记录它这个流程编排上的这个,呃,上下文啊。 嗯,好的。然后,呃,对,然后又有一个新的问题进来,然后这位开发商比较关注的是 kano swift 是 不是只能用于 token 生成, 还是它的适用范围有多广啊?那么我们还是请赵老师来给我们分享一下。嗯, ok。 kano swift 我 们是先做了 token 算子的一个生成,但是它不局限于只能生成 token。 呃,因为它这个框架具有通用性,它并没有指定语言,所以原则上只要定义清楚这个问题,并给出这种评判标准,然后 control switch 都可以进行自主进化来给出一个解决方案。 那我们现在正在做的是为多后多芯片后端,然后生成这种呃类 c 语言的一个算子,包括 ac, 然后还可以生成泰尔浪这种多 dsl 的 这种算子正在做。嗯, ok, 好。 然后对,看还有没有其他的一些相关的问题, 是不是我们的时间现在也不知不觉已经过去一个小时了,那么我们再找最后的一个问题。好,然后咱们就把这个问题吧。然后这个问题是用 a 整数生成的算子,然后性能跟人工金条的差距到底有多大?到底能不能直接上生产? 好,然后这个问题请请冯同再给大家做一个分享。嗯,这个其实就像我上个之前那个问题回答的差不多,就是在目前在那个固定的一个模型场景中,然后二战呢,生成算子的一个性能表现 还是比较可观的,然后性能区间也可以达到人工金条手写算子的呃零点六,然后到零点六倍以上, 不过像跨场景的一个泛化能力,呃目前还是不足的,但是在实际的一个开发的过程中,呃也可以帮助我们提升很大的一个效率。研发人员其实可以呃基于二阵子,然后生成一个算子的一个成果,然后进行一个二次的优化, 然后进行呃和适配的一个修改,然后这可以显著的那个呃缩短我们的开发周期,呃也是一方面提升了一个整体的一个开发的效率, 嗯, ok, 好 的。然后不知不觉的话就是我们这个直播已经持续了一个多小时了,然后最后的话就是还是感谢直播间的小伙伴们的陪伴,还有积极的提问。然后我们今天的呃这样一个主题的直播, agent 升级,就 agent 一个升级智能高效重塑 ai 开发体系 主题分享,然后到此就结束了,然后我们整个鲲鹏和升腾创享乐的这样一个系列的直播活动,然后我们也是最后一场,然后今天到此结束,然后欢迎各位呃开发者朋友们,然后在明天和后天就是二十二号和二十三号这两天, 然后鲲鹏生腾开发者大会还将继续在北京的中关村国际创新中心,然后进行一个线下的这样一个举办,然后欢迎各位开发者朋友们,然后能够到现场交流互动,最后谢谢大家,再见。