粉丝1.2万获赞19.2万

openai 凌晨再放大招! gpt real time 二语音模型正式上线!有位网友已经接入小龙虾, now tell openclaw to navigate to the wall street journal website got it i'll ask openclaw to navigate there now 这不是简单的语音模型升级,而是把 gpt 五级推理能力直接塞进了实时语音交互里,直接超越谷歌语音模型,强势登顶榜首! 他能够边听边推理,在你说话的同时一心多用,同步推理调用工具并行,低延迟就能给出建议与结果。一百二十八 k 超长上下温,超长对话不见望,复杂任务从此告别档机,你可随时打断纠正对话,他都能无缝衔接,对话流畅度直接拉满, 官方跑分测试直接飙高百分之十五点二,语音识别准确率高达百分之九十六点六,还支持五档推理强度调节。目前模型 api 已经开放,开发者可自行接入,自由平衡、延迟和深度打造生产级语音代理。 当 ai 语音一次次的迭代突破,语气和停顿都与人类相似时,你会用在我们日常生活中的哪个场景呢?来评论区聊聊吧!关注科技区角,看见更全面的科技世界!

直接把谷歌按在地上摩擦, openai 凌晨一口气发了三个语音模型,分别是 gpt realtime two, 这是它们第一个含有 gpt 五推理能力的语音模型。还有 gpt realtime translate, 也就是实时翻译,这是七十种语言的输入,以及 gpt realtime whisper。 你 一边说它一边出字幕。而且在 scale 的 audio multi challenge s two s leadable 上面, jupiter real time two 直接击败了前阵子 google 推出的 gemini three point one flash live, 登顶了榜首。但这都不是重点,重点是语音模型的风向开始 变了。以往我们对于模型的固有印象是,声音是不是更像真人了,语气是不是更自然了,会不会笑,会不会停顿? 但这次 gpd 就 打破了这个常规语音模型,开始朝着听懂你能推理、能接任务的语音 a 准方向发展 了。也就是说,听起来像这人还不够,有思考能力才是他最大的亮点。我现在就带大家过一下 openai 官方的测试题目,我抽几题念给大家听一下,你就可能会有感知。 第一道题考的是商业分析能力,题目是有人想在通勤铁路站旁边开一家精品咖啡馆,租金很贵,但他想做慢节奏的手冲咖啡,本地烘焙,而且有舒适的座位。如果一年后失败,最可能是什么原因导致的? 在这次开店之前,最小的测试方案是什么呢? g p u 太 two 的 回答呢,很靠谱。他说,最可能失败的原因是商业模型和客流节奏不 匹配,你租金很贵,但你做的是慢节奏的产品,可通勤站旁边的人要的是快,人家早上赶车,你在那边慢慢的首充,你很优雅,但客户很崩溃。而且他还给了一个最小测试方案,他说不要着急签大足约,先在车站旁边摆一个小摊,只测试周二到周四的 早高峰,看复购,看价格接受程度和出餐速度。你看,这是有思考的回答。至于 gpt 预判 one point five 的 回答也提到了租金压力、 下午的客流不行和建议摆摊测试,但整体还是比较模糊的,他用了很多可能也许这些词测试方案也没有说清楚具体是哪几天哪几个小时。所以这一题呢, g p v o t two 呢?小胜再来看一下下一题。这一题考的是空间推理能力, 题目是,我在酒店的走廊找二幺四房间,我右边刚刚路过二幺八二二零二二二,左边路过二幺七二幺九二二幺,我应该是继续往前走还是往回走呢?二幺四在哪一边呢?这题看起来简单,但语音模型要一边听数字,一边在脑子里建立地图,还 还是有点考验的。这次 g p t v 六还是答对了,他说应该往前走,因为你走的方向房号在变大,二幺四比二幺七和二幺八都小,所以在你的身后,而且偶数在右边,所以呢,二幺四在你刚来的方向的右手边。这个答案呢, 完全正确。相反, g p t v 六 one point five 就 离谱了,他说房号在减小,所以呢,继续往前走,直接把方向都搞反了。 我们来看最后一题,考的是纯逻辑推理,原题里用的是一堆虚构的词汇,什么达克斯、沃格斯、尼姆斯,我想你应该看都看糊涂了。所以呢,我换成大家熟悉的动物就好懂一点。以狗狗为例,这题你可以理解为这样,所有的贵宾犬是狗,有些狗是导盲犬, 没有导盲犬可以进入商场。问,通过以上条件能不能推导出有些贵宾犬不能进入商场?我想并不是所有人都能马上答出来啊,而且这里面还有个坑呢,我直接说答案 是 no。 因为有些狗是导盲犬,不等于有些贵宾犬是导盲犬,所以你不能推断出有些贵宾犬不能 进入商场这个结论。 g p t v two 呢,就试破了这个坑,他说不能推导出来,因为我们不知道达克斯和尼古斯有没有重叠,用狗狗的例子替换,也就是说,我们只知道有些狗是导盲犬,但不知道这些导盲犬里面有没有贵宾,所以无, 无法推断出贵宾犬不能进入商场这个结论。但 g b t v 二 one fine 呢,就明显掉坑里了,他开始就默认有些狗是导盲犬,里面一定含有贵宾犬,所以后面的推理过程都是错的。这一题 也是 g b t v 二 to 完胜。我想你现在应该明白了什么是带思考的语音模型了,而且 openai 还列出了两个测试数据,一个叫 b bench audio, 你 可以理解成这是一个语音模型,听完之后到底会不会思考,不是只听清楚你说了什么,而是能不能基于语音内容做推导。 g p p v o i two 在 这个测试上比上一代高了百分之十五点二。另一个测试叫 audio multi challenge, 这个更接近真实语音 agent 的 场景, 考的不是会不会聊天,而是多轮对话里面能不能听懂指令,记住上下文,而且前后逻辑不打架,中途用户改口了,还能不能跟上? g p u i two 在 这个测试上呢,比上一代高了百分之十三点八。所以你看, open i 这次不是在比 谁的声音更甜,它是在比谁更能在真实工作场景里面不掉链子。更有意思的是, open i 还讲了一个更大的趋势,他说语音正在变成人与软件之间的 新界面。什么意思呢?我们来看看官方的三种场景的解释。第一种呢,叫 voice to action, 也就是说 你开口提需求, ai 直接去办事情,比如你说帮我找预算内的房子,不要靠近主干道,顺便约周六看房。他不是只回答你一句好的,而是自己去理解需求,调用工具,筛选房源和排时间,这不就跟龙虾差不多了吗?第二种呢,叫 six to voice, 也就是说系统把复杂的信息主动讲给你听,比如你的航班晚点了,系统不是甩给你一堆冰冷冷的通知,而是直接告诉你,你的上一班飞机 晚点了,但你还能够赶上转机,我已经帮你找到了新的登机口,也规划好了最快的路线,看到没有?这能力像不像你的晋升助理?第三种呢,叫 voice to voice, 这个更好理解,就是 ai 班真实对话, 跨语言进行下去,你说中文,对方说英语或者德语, ai 实时的翻译,让两个人能够直接的聊下去,以后克服工作、跨境生意、海外旅行、跨 国会议,都不需要有同声传译了。所以这就 g p t u two 的 更新传来了一个重要的信息,语言模型开始从会聊天变成了会接活了。以前你用 ai 要打开软件输入提示时复制到别的地方,有可能以 一句话就可以了。帮我整理刚才会议里客户最在意的几个问题,顺便生成一份跟进方案,他就开始吭哧吭哧的干活了。当然,别激动到以为明天所有的客服都要下岗了,成本呢?延迟啊,系统接入、隐私合规这些问题呢?还需要解决。 所以现在还不是语音 a 整全面替代员工的时候,但是他已经从实验室开始往真实业务现场 膜的一步,相信那些重复的人工流水线工作, a i a 准很快会全面接管。你对这个会干活的语音模型有什么想法呢?我们在评论区里讨论一下。 ok, 以上就是今天的所有分享,关注沉香,我们下期再见!

我今天提到的 openai 最新的王炸模型,实时语音,那个模型不是说像呃,你们可能理解的那种,要把这个语音翻译成文字,再把文字翻译成语音,这种交互的这种模式它不是的,它是实时的, 他是判断他听都是语音,没有中间这个翻译的过程,没有把文字转语音,也没有把语音转文字的过程,就是通过这个声音去理解,你知道吗?就现在我们知道这个 ai 啊,去理解文字, 现在是直接理理解语音,而且他的这个能力其实在呃,半年前这个恰的 g p c 的 一点五, real time 一 点五已经出来了, 他在美国的各大房地产公司在应用,他们就接那种客服的电话,就是以前的成交率是百分之六十五,那么现在二点零出来了,成交率高达百分之九十五,什么概念? 很恐怖的,也就是跟你真人对话了,在我们的豆包有这个呃,实时打电话功能,有点类似啊,但他那个是不是通过转转文字?还是仅仅是速度快?我说不上来,但是 open i 这个是直接处理语音的, 而且他的推理能力已经相当的强啊,就跟正常的人交流,你想想现在的 g p t 这些 ai, 他的大脑已经完全超越了现在普通人的这种推理能力,那他的语音也达到了这种推理能力的话,那跟你正常人交流有什么区别?那你这所谓的英语教练,英语私教语言教练,对吧?有什么还有什么能够跟他去比呢? 所以这个东西他可应用的场景真的非常多呀。 嗯,现在咱们国内做的好的也就是豆包,对不对?豆包的那个打电话功能你们可以去试一试啊?然后那个功能是绝对远远超过它的。

openai 正式发布三款全新实时语音模型, gptr 一 a l t i m 一 二 gpt real time translate gpt real time whisper 一 举覆盖智能对话、实时翻译、流势转写三大核心场景。旗舰 gptr 一 a l t i m 一 二,推理能力达 gpt 五级别,支持超长上下文并行工具调用与智能打断处理语气自然可控。 translate 模型支持七十种语言输入与智能打断,处理,语气自然可控。 translate 模型支持七十种语言输入实时翻译。 whisper 专注低延迟流势语音转写,边说边出文字,即将登陆叉 gpt 音频模式。

哈喽,大家好,欢迎来到像素财经,以像素之威洞察科技财富风向。今天聊聊 open ai 重磅新动作,一次性上线三款实时语音模型,正式把语音 ai 带入 agent 智能体时代。 这次更新了 gbt rhythm 二实时翻译模型,还有流式语音转写模型。重点的 gbt rhythm 二直接给到 gbt 五级别的推理能力,上下文拉到一百二十八 k, 还能调节五档推理强度。 往后开发者可以轻松做实时倾听、自主推理,还能调用工具的语音助手,不再是简单聊天、智能客服、车载交互、在线教育这些场景语音 ai 智能题马上就要集中爆发!关注像素财经,带你紧跟全球 ai 科技,一手干货!

五月八日, ai 热点 open ai 发布三款实时语音模型,第一, gpt realtime 二,面向实时语音对话,它具备 gpt 五级推理能力,可以在用户说话时同步理解上下文,支持工具调用,也能处理用户打断。 第二, gpt realtime translate, 主打实时翻译,支持七十多种输入语言,翻成十三种输出语言,目标是尽量贴近说话速度。第三, gpt realtime whisper, 专注低延迟语音转文本,适合直播字幕、会议记录和客服质检。 三款模型都通过 real time a p i 提供,也能在 playground 里直接测试。价格方面, real time 二,按音频 token 计费, translate 和 whisper 按分钟计费。今天的信号很清楚,语音 a i 正在从能听能说升级到边听边想、边议边做。你最看好哪一个场景?评论区聊聊。

来这边这边再去玩下 gp 二点零啊。好吧,来我们再玩下 gp 二点零。 gp 二点零适合做什么?适合做展板?适合做展板,你像这种改图的话,我个人觉得香蕉还是好用点。呃,你们记住一个点就行了。什么点呢?就是一旦涉及到图里面有文字的,有文字的你这边的话就用 gp 二点零,如果图里面没有文字的, 你这边的话,呃,可能需要什么做渲染的,就用香蕉发给大家演示一下 g p 二零啊,那比如说我做这样子对不对?我就用我们右侧的真体去做。来,我们同样用右侧的真体去做,左侧也可以去做的,左侧点击超级 ai 的 g p 二零就可以了,我们用右侧的,好吧,来,呃,就比如说我把它做成一个展板,那我就点击一下原图,好吧,他就把我们的图片看到了吗?右边的话 就会直接把抓取上去。抓取上去。抓取上去之后呢?接下来我们输入对题的词啊,就比如说我要做成什么,对吧?材质物料版什么分析图啊,来我们直接点击,点击下面这个整体啊,可以选择模型看到吗?图片生成。来我们用 g p 二零,我们选择 g p 二零零,然后的话选择对应的分辨率,比如说我要做四 k 的, 四 k 的 话只支持六个分辨率的,六个比例的, 十六比九比十,六二比一,还有我们一个九比二,十一比九啊,好吧,给大家讨论呃库加乐的,库加乐的那个什么全景怎么去截取啊?这个是属于呃库加乐的课程啊,你这边如果是我们的联会把那个进阶课发掉, 渲染器都可以删了。呃,未来的话,其实说实话,呃,你们这边如果是能尽早去接触 ai 的 一定要尽早去接触 ai, 包括能深入体验 ai 的 一定要深入体验 ai 啊,因为很多一些渲染器的话,他们现在也在往 ai 方面去靠,明白吧?你们自己也感受不到,不管是像 d 五呀,对吧?包括像什么酷加乐呀,包括像什么?呃。一些其他的比如说 instagram 啊,全部都在往 ai 上面去靠,因为这个的话它是一个趋势好吧。 呃。找,我是会员找谁要课程?大东老师大东老师, ok, 来展版提完了来。高不高级?各位高不高级?这个题的词的话, gpt 的 题的词我等一下都可以更新在我们这个大缸里啊,我下播之后就更新在大缸里。最后一样,你们到时候要用 gpt 去做这种展版的话你们直接拿去做,拿去用 来 gpt 做展版真的没得讲,包括 gpt 现在也可以去做一些简单的实用图了,可以去做一些简单的实用图了好不好?而且的话,呃,基本上你成为我们的一个网易,这些东西全部都拥有,也不需要你自己去用什么魔法,对吧?全部都可以用了好吧。呃。然后再给大家做一个什么什么爆炸图啊, 来,只要你把提示词对吧写到位了,那也没问题那也没问题。呃。给大家再做一个家具的搭配爆炸图,包括室外的一样的逻辑啊,我给大家演示一个室内的就差不多,因为室外是一样的逻辑,提示词的话都不用你怎么去改。好吧,来点击生成, 这个就是我们现在 ai 的 一个意义啊,你想一下你以往的话,你去做这样子一个展板,你需要花多久时间?你哪怕是老手的话,我相信那些老式的是也懒得去做这东西,对不对?对吧?什么木饰面的,把所有的一些什么材质都提取出来啊?太麻烦了,对不对?你现在能用 ai 做,你为什么不用 ai 做呢? 对吧? ok, 我 给大家演示这个差不多了。 ok, 那 这边怎么去找到我们?包括怎么去我们这个插件让我看到你。

语音入口被 open n e 又窃窃了一层。这次 real time api 上线三款新语音模型, gpt、 real time 二、 translate、 whisper。 别只看成诱发模型,重点是 openai 把语音 ai 拆成了三件事,听懂、翻译、实时对话。先看 gpt、 real time 二,名字里最关键的不是 gpt, 而是 real time, 它要解决的是人和 ai 直接说直接回的问题,不再是打一段字,再等一段回复。这件事为什么重要?因为很多场景里,打字本来就是障碍,开车、做饭、客服、开会、操作设备,真正顺手的入口都是语音,谁能把实时语音做顺,谁才更接近 ai 助手。 第二个是 translate 翻译,它的重点不是翻译有多新,而是 openai 把跨语言沟通单独放进了 realtime api, 过去可能要录音转文字翻译再读出来,链条很长,体验很像拼装。现在 translate 被放到 api 这一层, 信号很直接,开发者接入跨语言,语音能力会更容易,翻译不再只是一个独立工具,而是实时语音列录里的一个模块。第三个是 whisper, 这个名字大家更熟,它一直和语音识别绑得很紧。放在这次更新里,它更像底座,先把人的声音变成 ai 能处理的信息。所以三款模型放在一起,是 逻辑很清楚。 whisper 负责听懂, translate 负责跨语言。 gpt、 real time 二、负责实时对话,一个管输入,一个管转换,一个管交互。 openai 不是 只做一个会说话的模型,它是在把语音 ai 的 关键环节拆开,再通过 api 交给开发者组合。普通用户短期可能感觉不强, 但对开发者来说,门槛在下降,以前要做一个像样的实时语音 ai 产品,需要自己拼很多组建,现在这些能力被集中到 realtime ai 里, 产品能更快搭出来。但别神话模型上线不代表体验立刻完美,真正难的还是延迟、稳定性以及场景设计。语音 ai 最怕的不是不会搭, 而是慢半拍、听错话乱打断,用户对语音的耐心比对文字低得多。我的判断是,这次更新不是单点炫技,而是 open a i。 继续把语音作为 ai 入口。做成产品以后,很多 ai 应用可能不再从输入框开始,而是从一句话开始。如果这条内容对您有启发,点赞加关注,方便以后回看,感谢您的观看!

开会时你还在想怎么回邮件? ai 已经把事办完了。 open ai 这次最狠的不是让语音更像真人,而是让它真的开始干活了。 这次升级的核心是实时语音 ai, 它不再只是听一句回一句,而是边听边理解边处理。 open ai 直接给开发者上了三款实时音频模型, gpt real time 二、 gpt real time translate、 cpt real time whisper。 哦哟, 一个负责实时对话和复杂任务,一个专攻翻译,一个负责转写。方向很清楚,不是做一个会说话的工具,而是做一个能接住场景的助手。 最能说明问题的是那个航班改签场景,人在亚特兰大,突然收到明天飞纽约的航班,取消了,直接开口让 ai 找下一班,还要低于四百美元。这里面有出发地、目的地、时间预算、动态解锁,任何一项都不简单。 但模型不是只回一句正在查询,而是先安抚,再检索,再筛选,最后给出一个大约两百四十五美元待转机的方案。 更绝的是,它还能并行查账户、查物流、作退款键替换订单,边处理边用,让我查一下这种短句,维持对话节奏。 这次升级还把上下文窗口拉到一十二万八千 toc 长通话、客服、会议、面试这些场景终于不容易前后失忆了。开发者还能在 minimal 到 x high 之间调推理强度,简单问题求快,复杂任务求稳。 测试结果也很直观, big 版本 audio 上 gpt real time 二 high 达到百分之九十六点六,而上一代只有百分之八十一点四。多轮指令测试里, x high 也明显更稳。 说到底,语音 ai 真正的分水岭不是声音像不像人,而是它能不能把人不想亲自处理的事顺手办完。 open ai 这次升级的重点就在这里。新模型不只是分数更高,而是更能处理真实世界里的脏数据。尤其是医学行业术语这类高门槛内容识别更稳,语气也能按场景切成平静共情或者积极振奋。 也就是说,语音 ai 开始像一个真正能上岗的助手,而不是只会机械复读的播放器。更值得注意的是, g p t real time translate, 它不是那种等你说完一句再慢慢翻的工具,而是边听边译。 它能理解七十多种输入语言,还能用十三种语言回应。重点不是逐词对照,而是尽量保住原意,跟上语速,吃透口音和语境切换。 它的价值不只是看得见,而是能顺手把信息结构化,边说边出自意味着笔记、摘要、代办事项都能同步生成。 open ai 这次其实已经把语音 ai 拆成三种方向, voice to action、 voice to voice, systems to voice。 前者是让 ai 替人把事做完,后两者是让沟通和提示更顺滑。所以这次最关键的不是又多了几个 模型,而是语音 ai 终于从掩饰能力走向基础设施。价格已经公开,开发者也能直接接入测试。接下来真正拉开差距的,不是谁更会聊天,而是谁能把语音变成工作流的一部分。关注全球 ai 速递,获取更多 ai 前沿资讯。

大家好,我是娜娜。就在二零二六年五月七号, openai 一 口气放出了三款全新的实时语音模型,直接干了两件让整个科技圈震动的事。第一件是把 gpt 五级别的推理能力 完整塞进了端到端的语音模型里,让 ai 语音助手从只会听话回话的工具,变成了能边跟你聊天边把活给干了的实时协助伙伴。 第二件是把同声传译这件事的成本直接砍到了地板价,能精准跟上发言人节奏的实时同传,现在每分钟成本只要两毛五人民币。这两件事放在一起,从来都不是一次简单的模型参数更新,而是 open ai 直接给下一代语音交互划了一条全新的行业基线。 今天这期内容,我们就把这次发布的所有核心细节,真正的能力升级,还有它到底会冲击哪些行业,改变哪些商业逻辑,一次性给大家讲透。 先把最基础的事件给大家交代清楚。这次 openai 是 在 real time api 里一次性上线了三款音频模型,分别是 gpt real time r、 gpt real time translate, 还有 gpt real time whisper。 这三款模型不是孤立的单品,而是打包成了一套完整的音频能力矩阵,分别对应实时语音、智能体流逝、同声传译、低延迟流逝转写三个核心场景, 把语音交互的全链路能力一次性全部开放给了开发者。先给大家把三款模型的基础定位和核心信息一次性说清楚。 首先是这次的绝对重头戏 gptrealtime 二,这是 openai 首款搭载了 gpt 五级推理能力的语音模型,也是这次更新里最核心的产品。 然后是 gptrealtime translate, 主打流利童声传译,支持七十多种语言输入,实时翻译成十三种语言输出,定价每分钟零点零三四美元,折合人民币约两毛五。 第三款是 gpt realtime whisper, 负责边说话边出文字的低延迟流逝转路。定价每分钟零点零一七美元,折合人民币约一毛钱。 openai 在 官方薄刻里说的非常明确,这次发布的核心目标就是把实时音频从简单的一问一答推向真正能干活的语音界面。这句话是什么意思? 过去我们用的语音助手,本质上是语音版的关键词搜索,你说一句,他回一句,一次只能处理一件事,稍微复杂一点的多步骤需求,他立刻就卡壳了。 但这次的三款模型,是要让语音变成我们和数字世界交互的最自然的接口,你不用再学习怎么用键盘,怎么点菜单,怎么写精准的提示词,只要张嘴说话, ai 就 能在对话的过程中边听边推理边翻译、边转录边执行操作。为了让大家更直观地感受到这个变化,我们先看几个已经公开的实测案例。 openai 员工 jason liu 对 着麦克风说,英语 gpt real time translate 直接实时翻译成了日语,整个过程是完全流势进行的,根本不需要等说话人说完,一整句翻译就已经同步跟随输出,几乎没有可感知的延迟。还有网友 clarevo 把 chat p r d 和 gpt real time 二结合, 对着麦克风说了一句,帮我写一份产品需求文档,接下来的十分钟里,他一次键盘都没碰,全靠语音对话, ai 就 生成了一份完整的 prd。 之后他再用语音要求调整格式、补充细节, ai 也能实时更新,全程完全是对话驱动。 还有网友 ben badger 把 gpt realtime 二和 openclaw 集成在一起,直接用语音指挥 ai 操控浏览器,说打开 google, 跳转到华尔街日报, ai 一 边执行操作, 一边还主动汇报进度,正在打开浏览器。现在跳转中。他自己说三月份还在琢磨怎么给自己的项目搭一套语音对讲系统,现在只需要把新模型接进去,几分钟就完成了全部升级。 这些案例不是实验室里的概念演示,而是现在已经开放给所有开发者在 api 里就能直接调用的成熟能力。 接下来我们就深入拆解一下,这三款模型到底带来了哪些真正重要的变化,而不是表面上的数字升级。 首先我们重点说这次的核心产品 gptrealtime 二,它最核心的升级从来都不是语音识别更准了,也不是合成的声音更像真人了,而是把 gpt 五级别的推理能力完整地集成到了端到端的语音交互全流程里。 这是什么概念?过去的语音模型本质上是语音转文字加大模型,推理加文字转语音的三段式拼接,中间有明显的延迟,有信息损耗,而且一次只能处理一个任务。 但 gpt real time 二是把推理能力直接嵌入了语音交互的每一个环节,实现了真正的端到端实时推理。 第一个核心变化就是上下文窗口直接从三十二 k 拉到了一百二十八 k, 翻了整整四倍。这个参数对语音交互来说,意义远比大家想象的要大。 上下文窗口越大,就意味着 ai 能记住更长时间的对话内容,能处理更复杂的多轮任务流,不会聊着聊着就忘了你前面提过的需求和限制。 比如你跟 ai 说,我马上有个客户会议,帮我看一下日程,顺便更新 c r m, 把今天的会议招标和后续步骤录进去,再给参会人发一封提醒邮件。这种多步骤 化系统的任务,需要 ai 能完整记住你所有的需求,还要能关联不同系统里的信息。一百二十八 k 的 上下文窗口,就是支撑这种复杂任务落地的核心基础。第二个核心升级是推理强度,可以五档调节,分别是 minimal、 low、 medium、 high x high, 默认设置为 low 档。 这个设计非常精准地贴合了语音交互的实际使用场景。你问个今天天气怎么样?明天限行尾号是多少?用 low 档就能秒回,延迟极低。 但如果你丢给他一个商业分析的大题,比如帮我盘一下,在通勤火车站旁边开个九百平方英尺的独立咖啡店,失败的最大风险是什么?还有最小成本的测试方案是什么,你就可以调到差一档,让他拉满算力做深度推演。 这就解决了语音交互里一个长期存在的核心矛盾,简单需求要极致、低延迟,复杂需求要深度推理。现在开发者可以根据不同的场景灵活平衡两者的关系。 第三个也是最能体现 gpt 五级推理的升级,就是它支持并行工具调用,真正学会了边说话边干活。 过去的语音助手,你给他一个任务,他必须等你说完,然后静默一段时间,后台干完活再给你回复。整个过程是僵硬的回合制, 但 gpt real time 二不一样,它可以一边跟你说话,一边后台同时调用多个工具。比如官方 demo 里,用户说,我马上有个客户会议,能帮我看一下日程吗? 模型会立刻查看日历,回复说,十二分钟后,有一个跟 sablecrest robotics 的 cto alex kim 的 会议。同时后台已经同步更新了 crm, 把会议相关的信息和后续步骤录进了系统。 它还新增了一个叫做 preambles 的 前置语功能,在后台拉取数据、执行操作的时候,会先跟你说一句,让我核实一下,或者稍等片刻。 这个看起来是一句无关紧要的废话,实际上最大程度缓解了用户等待时的焦虑感,就像我们人在思考的时候也会说,呃,让我想想,现在 ai 也学会了这种非常拟人化的表达,让整个对话的自然度直接上了一个台阶。 除此之外,它的语气也是完全可控的,平静、共情、兴奋三种核心语气可以按需切换,对专业术语、医疗词汇、专有名词的识别和保留能力也大幅增强, 甚至遇到处理不了的问题。他会主动说,我现在遇到点困难,而不是像过去那样静默失败或者直接打断对话,容错能力和异常恢复能力都有了质的提升。 这些升级不是纸上谈兵,而是有实打实的测试数据支撑。在 bigbang audio 这项专门评估音频推理能力的权威榜单上, gpt real time 二的 high down 拿到了百分之九十六点六的分数,而上一代模型只有百分之八十一点四,直接提升了十五点二个百分点。 在 audio multi challenge 这项测试多轮对话指令跟随能力的榜单上, x high down 跑出了百分之四十八点五的成绩,上代只有百分之三十四点七,又提升了十三点八个百分点。 企业实测的数据更有说服力,美国头部房产平台 zero 拿自己内部最难的对抗性批准跑了一遍。用了新模型之后,通话成功率直接从百分之六十九跳到了百分之九十五, 提升了二十六个百分点,而且在住房公平相关的合规性上表现也显著增强。这意味着什么? 意味着语音 agent 不 再只是接接电话、播报基础信息的工具,而是真的能处理高价值、高合规要求的企业级业务场景了。讲完了核心的 gpt real time 二,我们再来看这次最初圈的 gpt real time translate, 也就是实时同传模型。 说他出圈是因为他直接把同声传译这件事,从过去只有高端会议、跨国企业才用得起的特权,变成了任何一个开发者甚至个人都能随便用的基础能力。 先给大家算一笔账,就知道这个定价有多颠覆。人工同声传译英语语种一天的收费是一万二到两万一千元,非英语语种比如日语、韩语、阿拉伯语一万八千元起,而且通常需要两到三名议员轮换, 折算下来每小时的成本就是几千甚至上万元。这还不算同船间耳机、接收器这些专业设备的租赁费用,一套设备租一天也要几千块。 所以过去能用上同船的基本都是国际峰会、跨国企业董事会、高端医疗会诊、法律仲裁这些高预算场景,普通的开发者、中小教育机构、出海创业公司根本碰都碰不起。但现在 openai 给出的定价是每分钟零点零三四美元,折合人民币约两毛五。 按这个价格,连续翻译一个小时,成本不到十五块钱,甚至比一杯奶茶还便宜。连续翻译八个小时,总成本不到一百二十块,还不到人工。同船两分钟的价钱,两者的差距足足有六十六倍。除了定价,他的技术能力也完全能打, 他不是那种说一句翻译一句的回合制,而是真正的流势同传。说话人边说母语,系统边实时输出,翻译几乎没有停顿,完全能跟上发言人的节奏, 而且对口音和方言的包容度非常高。印度的 ai 公司包纳 ai 拿印第语、泰米尔语、泰卢故语这些口音非常重的语言去测试,发现它的词错误率比其他模型低了百分之十二点五,而且延迟能一直维持在适合自然对话的水平。 第三款模型 gpt realtime whisper, 主打低延迟流势转录,就是边说话边出文字,定价每分钟只要一毛钱人民币,一小时连续转写不到六块钱。 它的应用场景非常明确,实时字幕、会议速记、客服通话记录、课堂笔记。以后开会领导刚说完前半句,屏幕上的文字就已经跟上了,完全不需要等会议结束之后再转写。 讲到这里,大家应该能看明白, openai 这次不是发了三个孤立的模型,而是搭了一套完整的面向下一代语音界面的基础设施。 它把语音交互的三个核心环节,推理、执行、跨语言翻译、语音转文字,全部打包进了同一套 a p i 里,而且把价格打到了几乎可以忽略不计的水平。这才是这次发布最核心的意义,它不是让语音助手变得更好听,而是让语音真正变成了能干活的交互界面。 接下来我们就基于已经公开的信息,聊一聊这次的更新到底会带来哪些行业影响。首先最直接受到冲击的就是同声传译行业。这里我们必须先明确一点, ai 同传和人工同传目前还不是完全的替代关系。 更准确的说法是, open ai 做的是让同船这件事不再是特权。过去只有大型企业、政府机构、高端会议才用得起的服务,现在任何一个开发者都可以把它接近自己的产品里。 一个出海电商的客服系统,一个跨国视频会议工具,一个在线教育平台,甚至一个个人的 chrome 插件,都能拥有实时多语言翻译能力。那人工同船会消失吗?至少短期内不会。人类同船的价值会快速向上迁移, 比如涉及到文化语境、创意表达、法律条文的精确性、医疗领域的专业性,还有需要临场应变、情绪传递的场景,这些都是机器短期内替代不了的。 但不可否认的是,那些基础的、高频的、标准化的翻译需求会被这套 api 大 规模承接。过去很多需要人工同传的场景,现在用 ai 就 能满足,而且成本几乎可以忽略不计,这对整个行业的底层逻辑是一次根本性的冲击。 第二个影响是,整个语音 ai 市场的格局会被重新改写。过去这两年,语音 ai 赛道非常火热, eleven laps 靠你真的 ai 配音和声音克隆出圈,估值已经冲到了一百一十亿美元,年化收入超过五亿美元。 diploma 深耕语音识别基础设施,服务了一千三百多家企业客户。 cartesia 主打低延迟实时交互,靠着九十毫秒的极致延迟拿下了一万多客户。 这些玩家要么在声音拟真上做到极致,要么在延迟上卷到极致,要么在垂直场景里扎得很深。 但 open ai 这次进场最大的优势就是完整的模型站,它可以把语音识别、语音合成、大模型推理、工具调用、翻译、转写,所有的能力全部放在同一个开发者平台里。 对开发者来说,少接几个供应商就少了很多延迟集成和运维的成本。对企业来说,统一的平台也更容易做权限管理、日制留存、数据策略和安全审查。这对很多单点突破的语音 ai 创业公司来说,无疑是巨大的竞争压力。 当然,这并不意味着创业公司就没有机会了。垂直行业的深度优化、本地化的合规需求、更极致的声音拟真度,这些都是 open ai 很 难全覆盖的地方,但整个市场的竞争门槛无疑被抬到了一个新的高度。 第三个影响是,它会彻底拉平 ai 语音能力的门槛,让中小企业和个人开发者也能用上过去只有大厂才有的技术。 过去你想做一个带实时同传的视频会议工具,想做一个能语音操控的智能客服,想做一个能实时转写的课堂工具,你需要自己搭模型、做优化、找算力, 成本极高,普通开发者根本玩不起。但现在你只需要调用 openai 的 api 几行代码,就能把这些能力接近自己的产品里,而且成本极低。 这一定会催生出大量我们现在根本想象不到的创新应用,语音交互的普及速度会比我们想象的快得多。更深一层来看,这次的更新其实是在重构人和软件的交互逻辑。 过去几十年,我们一直在学习怎么适应机器,学习怎么用键盘打字,怎么用鼠标点菜单,怎么写提示词,让 ai 听懂我们的需求。 但现在 ai 开始反过来适应我们了。说话本来就是人类最不需要学习的本能, open ai 做的就是把这个最自然的交互方式变成了我们掌控数字世界的核心接口。 当然,我们也要清醒地看到,现在的 ai 语音能力还有明确的边界,比如复杂的多轮任务,它还是可能会出错,涉及到极高合规要求的场景,还是需要人工审核,文化和情感的细腻传递机器还是很难替代人类。 但不可否认的是, openai 这次的发布已经给下一代语音交互划下了新的基线,接下来整个行业都会跟着这条基线快速往前跑。 最后给大家说一下,这三款模型现在已经全部开放,最快的体验方式就是打开 openai 的 playground, 在 浏览器里就能直接测试,不需要写代码。想接入自己项目的开发者,官方也提供了 codex prompt 模板,一键就能把 gpt realtime 二接近现有的 app 或者新项目里。 好了,以上就是本期视频的所有内容,如果你喜欢本期视频,不要忘记订阅、点赞、分享,这样就不会错过每一期的精彩内容。感谢收看,我们下期再见!

突发, openai 刚发了一份语音 ai 新指南,这次重点不是让 ai 说得更像人,而是让实时语音 a 帧 t 更会办事。他要知道什么时候先思考, 什么时候给用户一句短反馈,什么时候调用工具,什么时候确认关键信息。也就是说,语音 ai 正在从能聊天变成能执行任务。未来客服销售助理类产品可能都要被重新做一遍。关注我,每天带你拆一个正在爆发的 ai 新趋势。

那么目前 open i 认为语言正在成为人们使用软件最自然的方式之一。 嗨,欢迎回到我的频道,本期视频我想快速的带你过一下。 open i 最近发布了一个 ai 语音 agent 的 一个三个不同的 api。 那么首先呢,这次发布了一共有三个音频模型,第一个是 gbtrealtime 二,那么它具有的是 gbt 五级别的推理功能的语音模型,也就是我的理解就是它就类似于最近很火那个 image 二一样, 它它整个后台的话是进行过推理,然后网络搜索,然后整理再来生成图片的,而不像之前的图片那种生成模型,可能 架构上会更更直白一点,虽然我没有啊认真看过它相关技术文档过什么,我大概理解这样。然后第二个模型是 gbt realtime translate, 就是 说它可以实时的,这里显示的是一种实时的翻译模型,就是说 在多人交流的时候,他可以快速的把呃不同的人说的话翻译成,并且输出成另一个人能听懂的口音,或者是那种感觉,就像如果你和一个呃美国人交流,然后你们都互相不会说对方的那种语言的话,他可以实现一种 没有任何语言隔阂,一种交流的体验。那么最后一种就是这个 real time 的 whisper, 就是一种呃语音转文本,但这个在这篇文章里面不算是什么太重点了。然后呢,你可以在这里去尝试一下 gbt realtime 二,那么为什么我要做这期视频是因为因为我之前是最开始接触 ai 的 voice 这个语言交流是在最开始在手机端的豆包上,因为手机端的豆包大家知道它的语言交流是 很像真人的,很有感情的,所以我当时用它去练练我的英语口语的话,其实是算是一个,对我来说算是一个从零到一的一个起步,所以我到现在也很感谢豆包,当时这个技术是完全免费的。然后后面的我,后面的话我喜欢在电脑上交流吗? 我尝试过 gbt, 然后尝试过 rock, 然后现在好像 jammer 和啊一个 cloud 我 就不说了, jammer 也有,但是我综合用下来,我目前一直觉得这个 rock 的 无论是在 呃这种声音的自定义上,还是各种选择上,包括回复的质量上都是最好的,如果是不考虑任何的 这种氪金的情况下,就免费版,然后 rock 是 最好的,反正我 gbt, 我 觉得他的回复无论是速度还是感情还是表达,因为他语言模式有时候会返回那些图片吗? 然后我不知道为什么在我的电脑上 gbt 回复的图片全是没有真显示出来,只是显示到底层那个文本。那我们这里可以跟他体验一下,比如说我现在可以给他试一下, 他现在会请求我们麦克风,我看一下能不能说话,一二三一二三啊,他正在连接, 然后比如说下面会有一些粒子啊,当然可以,比如手通咖啡的步骤是磨豆、焖蒸,分段注水,意式浓缩是细研磨,高压萃取法压壶则是粗研磨,浸泡后按压。 呃这个我觉得在这里体验,其实你感受不到它的效果图,说实话,因为它只有大概九十秒吧,而且没有那种上下文的话,其实我并没有看出来它和目前在 gbt 的 那个语言模式的模型有什么太多本质上的 质的变化,那我们接着往下看。那么目前 opi 认为语言正在成为人们使用软件最自然的方式之一 啊。比如说像在开车的时候,或者是我们去制定我们的旅行计划,比如说你到机场的时候,你没有那个很空闲的时间去打字,但是你就想语音,那么这个其实现在像什么 siri 或者那种像豆包手机里面的,我觉得这些都应该很成熟了。 ok, 那 这是他的一个这个文章总的一个基调吧,就是他认为现在语音一定要包含像推理还有翻译和转录。那我们先来看一下。 那么呃,他认为目前语音在软件方面的使用方式一共是围绕的 ai, 有 先的三种方式,一种就是语音到行动,然后反过来就是系统到语音。 语音到行动其实很好理解了,就是比如说,呃,像那个千问 app, 过年的时候你跟他说你,你无论打字还是语音,我相信点个奶茶什么的,大概就类似于这种,比如说这个 z 啊,他正在构建一个助手, 他可以去啊,给你导航,对吧?然后安,并且还能安排周六的旅行。这些我觉得其实已经很成熟了吧,但是可能之前 oppo 还没有太过于在这方面发力, 那么系统到语音那就是反过来了,就是说让这个 app 或者这个应用,它可以根据你的要求反过来告诉你,或者说主动地告诉你。比如说这里举了个例子,就是依然是这个坐飞机的,就是说它可以主动地告诉你 你的航班延误了,但是他会给你一种新的方式,那么后面这种新的方式就体现了,他不是那种被动式的输入,然后被动的返回,他处理结果就完了,他有自己的思考,并且他可以推理去告诉你可以另外怎么做。 那么最后一种就是语音到语音,那就是翻译的场景了,例如他这里举个例子说德国电信正在构建一个 可以让用户使用他们最喜欢用的方言来说话,然后模型可以实时的翻译。我觉得这个说实话, 呃,可能对于像我们年轻人说习惯了普通话觉得没什么,但是这种这种这种模型能够翻译方言的话,应用在很多那种像四五线的那种城镇或者县城里面的话 就就很有用啊。因为很多人他说普通话其实并不算是特别习惯过说那种流畅的,但是说方言就很。并且我前几天我也看到,目前像国内的千问,还有好像是混元嘛这方面,其实他们也好像是有有在训练这种方言的模型,我也看到了,或者是在采集这方面, ok, 然后这下面就是三个不同的图来表达了。 open, 它对当前 ai 时代下构建一个 ai 语音模型应用的三种方式,然后其实就很通俗易懂。 那么接下来呢?它展示了一个就是定航班的一个一个视频啊,我们可以去简单的看一下。 好,那接下来他的另一个重点就是实时语音,什么叫实时语音呢?就是他在与你交话的 交流的过程中,他可以快速的进行推理,然后去呃调用工具,然后处理或者什么,而不是说你问一句,他答一句,但是他啥也没干,大概就是这么说吧。 ok, 然后他可以定型的工具调用,并且呢我觉得很重要的两个点是,其实这里一个是他有更长的上下文,之前只有三十二 k, 现在增加到 一百二十八 k, 因为因为如果你没有更长的上下文,你还要算上你要调用工具,你要网络搜索乱七八糟的, 他区别一下,我们平时跟 siri 或者这种手机上的普通助手对话可能四五句,然后聊个两三回就结束了。如果你是要真正的在这种像定航班或者日常生活中上下文太短的话,他就会压缩,而而如果去发生像压缩的话, 那么这个体验就不行,因为因为语音膜这种交互对这种软件的延时性要求是非常高的,就是他的延迟得非常低。 那么还有个重点就是领域行业的了解,因为你看他保留了专业术语,专有名词,医疗保健术以及生产环境中重要的其他词汇, 也就是说 open i, 他 给这些模型的定位并不是说只是为了这种呃 t c 的 个人用户去平时 定航班这些的,他希望这能够把这语音模型真正的应用到像医院啊或是工厂里面的那种专业的场景,但是大家都知道这种场景是容不得一点的这种 疏忽的,所以说他对于准确率的要求会非常的苛刻,然后后面下面他会有个表格,说了一下他对准确性的进步有多大。嗯, 那么接下来这些就是不是很重要,我们看一下。 ok, 他 已经到了啊,首先是他的智力方面,他比目前采用的一点五啊提高了,我们看一下,提高了百分之十五点二,然后在音频多重挑战指令 上也有点进步。然后这里的话是举了五个例子,也就是说你给了他一个非常复杂的 你,你说早上几点几点要干嘛?然后下午要干嘛?你又喜欢去哪里去呃,坐着喝茶什么的,他一顿思考之后会告诉你啊,他觉得应该怎么给你安排这个东西。这个例子大家可以简单来看一下,但是这个这几个例子都是这种个人生活中的, 大家可以看到其实就跟你日常打字去问 ai 其实没什么区别,只不过是换成了语音。 那接下来就比较重要的,像早期的这些企业是怎么用这些模型呢?那主要其实就是用在去客,用在客服方面的, 因为这些模型现在可以丝滑的把客户的那种方言或什么转化为那种,比如说可能员工能听懂的话或者什么呢,所以这种就更好了。 ok, 那 么下一个就是实时的翻译,实时的翻译的话,他显示支持多七十多种输入的语言,但是只能输出十三种输出的语言。并且我其实呃就上面那个可以提示我问过他关于 呃像闽南语或者是普通话,他的表达其实就不肯定是跟豆包那没法比的好吧?但是他说英语是没有问题。然后然后这里又有一个例子,其实这个这个的例子是什么意思呢?就是 里面很多说的英语,但是你想让他按同样的音色,同样的音调,但是说出来是普通话,那么他就有这个功能,而且现在在 bilibili 上。 bilibili 上我记得也有一个功能,但是他语言支持还不多,这个语言是可以支持很多的好吧,这个的话也是很很很不错的一个功能, 那么接下来就是没有了。以上就是下面这个转录的话,我相信这个就没什么,算不上什么亮点。那么以上就是本期视频的全部内容了。呃,并且我会在这个模型真正的放进 check gpt 的 语言。模型后呢,我会做一期 全世界主流 ai 的 一个语言交流模式,模式下的从杭到拉。好吧,谢谢。 hey, everyone, we're introducing new real time audio models in the openai api in this demo, i'll show two of them gpt real time translate for life translations and gpt real time 2 for voice agents that can follow instruction and take actions let's start with translations because that one feels so magical, i speak french, but see i need to present to an audience around the world the english show here is the model's live audio output captured directly from this laptop with transcription now as i start speaking in french we'll lower the volume of my mic and increase the one from the model so you can have a real feel for it no added to the audio let's give it a try suki terezamprukhin suki modrukhin one really impressive is that the model can listen to me and translate while i'm speaking it waits for the keyword like the verb to start translating right, away exact amount and yellow and the result is a much more natural conversation just like a dialogue between two people i can even interrupt in german and the model switches effortlessly between my german and your french and we can even include technical terms like gpt real time open ai or computer use and the model has no trouble handling that messy bookkeeper isn't that amazing the mull can translate across 70 different languages in real time really following the shape of every sentence so whether you're building a media platform or tools for customer support or education we believe that this can help you break down the language barriers and this mull is just one of the ways we're improving voice intelligence so for the next demo let's talk about gpt real time 2 our new model that brings intelligent reasoning to voice agents so let's bring up my phone and take a look at my personal voice assistant hi, there hi again what's up yeah? i have a customer meeting coming up can you take a look at my calendar? you have a meeting with alex kim their cto great, thank you oh, please take quiet for a second until i say back to demo ramon, don't forget now that these models have things like reasoning and parallel tool calling it's even more important to use things like preambles this way the model can explain itself and update the user thank you jason for the great reminder very important actions can of course take a few seconds and so it's very important for the model to acknowledge those with gpt real time too you can communicate directly during the reasoning and the tool call link so the user stays informed and by the way what makes voice agents so natural now is that this in the conversation jason and i have been chatting demola has been listening and it's still listening now but not interrupting us until i say back to demo i'm here when you're ready to continue the demo pretty cool right so now let's highlight what jason just mentioned with preambles let's ask another task and say hey could you now update the crm and put the meaning of today as a brief and the next steps let me pull the latest context and update your crm sablecrest launched warehouse automation this morning expansion is active security review is the blocker all right thank you i'm all set please stick with it again i write this up what's exciting here is that you can now connect the model to any kind of system it could be your dashboard the services you're using even connected devices and so much more so that was a quick preview of our new real time audio model coming to the openi api you can now create agents that keep conversation going as they think in the background they can translate live across 70 languages they can even act inside the products you're already using voice can truly become the primary interface now and we can't wait to see what you build with these new models thanks for watching hey back to demo how was that smooth and clear it felt natural and demo friendly。

做一个他的那个什么爆炸分析图啊, gpt 二点零,他是非常适合做这个的,找到我们这个 gpt 二点零,也就是我们最最近比较热门的一个模型,然后比如说我要做这张图的分析图,对不对?我就直接按住鼠标右键把它直接拖进去,一个账号可以绑定几个电脑,不限设备的,不限设备的,然后提示词你怎么去输入呢?来我教大家直接找到我们。呃,往 下方这个资产库啊,平下方这个资产库看到吗?今天下午的话,我是给他上传了很多一些提示词啊,官方提示词这里对不对?往下去翻,然后这里的话会有可以看到 gpt 专用二点零专用材料,呃,材质物料分析版来我们这边复制粘贴就可以了。 比例这边我们可以去调一个十六比九的,十六比九的包括什么家具搭配爆炸分析图啊,不对,来我们这样一样的把题词改一下就可以了,对吧?就是我这边已经把题词词都给它写好了,你们这边直接复制粘贴去用就行了,对不对?所以说你们用起来便捷度也很高,便捷度也很高,来 把这个题词词换一下,对不对?然后点生成,最多是支持六个任务同时并排。六个任务同时并排,为什么我图放大了都出来了,不知道为什么不见了?历史记录的话在我们这个右下角,在我们这个右下角是可以看到的,这里是一个历史记录的,看到吗?点击进去,今天包括之前你们所做的所有的图,历史记录 全部都有,包括视频,对吧?全部都有,如果你发现你的图就是不见了,对不对?你们这边可以在左下角这个历史记录,就是这个图画布里面可以去找到,可以找到,好吧,左下角那个 gbt 二点零呢?爆炸图看到吧?肯定好了呀,对不对?这个还带有什么走向主要动线什么的对不对?次要动线功能分区,然后这个就是我们材质解析,看到吗?全部都可以去做,看到了吧? 好吧,包括你看,就是你们去做汇报的时候,这个是很有用的,因为你就算是再经验丰富的一些设计师啊,你也不愿意去做这些东西,对吧?把这什么分析,那现在能用 a 棒去做对不对?那肯定让 a 棒去做,对吧? 可以了,这个的话你直接用就可以了,在我们超级版本里面的这个 gbt 二点零二,现在一张图的话,一 k 只要几分,一 k 只要几分,四 k 的 话都只要差不多一毛左右,一毛左右,好吧。 爆炸免费的吗?提示词提示词都是免费的啊,我现在的话大家可以看到,我今天下午的话给大家更新一波官方提示词,就是你们点击来大家很多人不知道仔细看一下,仔细看一下我箭头打的这个位置,看到吗?他是有一个资产库的,你们点击进去看一下就知道,我今天下午更新了的,现在是更新上传了一个官方提示词的。官方提示词,我今天直播间演示的所有的提示词全部都在这里面,包括什么爆炸分析图啊,多角度统一啊,都在这里面,包括洗图的,对不对? 都在这里面,你们直接拿去就可以了,好吧,就这样子就避免大家,对吧?又打开一个什么文档,又打开我们什么大纲啊,对吧?太麻烦了,直接在网易云里面就全部搞掉。 ok, 那 这边想了解更多同学可以直接在我们,我继续把我们风暴页大纲免费的发给大家。现在已经更新到第九十几页了,非常多的题词,室内室外景观建筑的全部都有,如果想领取同学可以直接在我继续的免费的发给大家。

如果你还在靠手动复制粘贴来处理文档,那你就彻底掉队了。现在的 ai 巨头们已经不再满足于在对话框里和你聊天,他们正带着长久记忆入侵你的桌面。三分钟 带你看透今天最值得关注的三场生产革命。第一, cloud 终于住进了微软 office 全家桶。现在从 word、 excel 到 ppt, 你 都能直接调用 cloud 的 能力。但这事最狠的地方不在于它能帮你写稿, 而是在于它拥有了跨软件的连续记忆。以前你在邮件里聊方案,换到 ppt 里, ai 就 断片了。现在 cloud 实现了对话同步,它能记得你在 autodesk 里交代的每一个细节。 ai 终于从一个只会一问一答的聊天框,变成了一个真正懂你、业务、能陪你全程通关的数字员工。第二, openai 正在把同声传译装进你的手机。 openai 刚刚开放了 gpt real time 二的推理语音能力, a p i。 简单说,以前那种你说一句 ai 想三秒的尴尬对话结束了。 现在的语音智能体不仅反应极快,而且能听懂模糊的音频,甚至能在超长对话里稳稳维持状态,电影盒里的那种时时陪伴。现在每个开发者都能把它做成产品。 第三, ai 模型的平替时代彻底到来了。 gemini 三点一 flashlight 已经在 openroot 上架,价格低到离谱, 一百万个字母的输入居然只要零点二五美金。它不仅支持文字,连视频、 pdf 都能一把缩处理,还给了你不同等级的思考深度选项。这标志着 ai 规模化应用的成本门槛已经彻底消失。 从跨软件办公到实时语音交互,再到极致的性价比, ai 正在像水和电一样,悄无声息的重塑我们的生活底座。关注我,陪你一起见证硅基生命的进化!

五月八日 ai 全球演一分钟播报首先来关注语音 agent 的 竞争正在从能不能说话,进入能不能低延迟、低成本、跨语言的工作。 open ai 发布 gpt retime t 二、 gpt real time translate 和 gpt real time whisper api 覆盖实时对话、翻译和转写链路。它的意义不只是语音效果更好,而是把客服、会议、同传教育和车载 ai 所需要的基础能力进一步打包成可调用的产品底座。 接下来要观察的是语音 a 阵的会不会像文本 a 阵的一样进入价格战,以及企业客户是否开始把呼叫中心和会议工作流大规模迁移到这类 a t i 上。继续关注 ai 数据中心的瓶颈正在从 g p u。 扩散到电网。 美国最大批发电力市场之一 p g m。 因为数据中心和 ai 用电需求增长推动电力市场规则调整。这里的核心矛盾很直白, cpu 越多,用电并网和峰值负荷压力就越大,投资链条也因此变得更清楚,直接受益的是有电力资源的数据中心运营商和公用事业公司。二、接受益是变压器 开关设备、液冷储能和电力工程,而拿不到稳定电力的 new cloud 和云扩容项目可能会被拖慢。今天,全球演一分钟播报结束了。

hello, 欢迎收听 ai 日报一、 openai 发布了 real time a p i 实时语音模型的全家桶, gpt return p r 面向复杂实时语音交互,强调边听边思考。 gpt return translate 多语言实时翻译。 gpt return looper 实时音频转录,这不是普通语音识别更新精准测试结果显示, gpt realtime o 在 bigbang audio 上比上一代高了百分之十五点二,在 audio multi challenge 上高了百分之十三点八。 定价方面, gpt realtime whisper 是 每分钟零点零一七美元, gpt retry translate 是 每分钟零点零三四美元。 gpt replay time 二、按 token 计费, 输入三十二美元每百万 token。 音频输出六十四美元每百万 token。 二、 anthropic 推出 cloud manage agents 新功能, 梦境结果验收多智能体编排 web hooks, 其中梦境用于整理 a 诊的记忆。结果验收让 a 诊自动检查任务结果。多智能体编排,支持复杂任务拆分。 web hooks 让 a 诊更容易接入外部工作流, 哈维启动相关能力后,任务完成率提升约六倍。三、火山方舟抠钉子案近期上新多款模型面向个人用户的订阅式大模型服务套餐包, 该套餐在 coding 基础上升级而来,主打 agent 场景,新增深图与深视频模型及联网搜索等,提供 small medium large max 四档套餐。四、快手推出 corework, 工作流变成了桌面应用,在 corework 里只做了一件事,把需求打进去。 几分钟后,一个完整的深色科技风桌面应用就出现了。五、美团公测 ai 社区蜜游由美团基础研发、 ai 创新团队打造,已入驻三千家 agent, 提供内容互动、技能管理等功能,这代表 agent 正在从工具变成社区生态。 agent 不 只是帮你完成任务,也可能成为内容服务和社交节点。六、 runninghub 推出原生 ai 智能体内容创作平台 r h t v, 支持 comfyui 工作流 无线化布、 ai 应用与模型 api 调用等全能创作工具。七、 lightseek foundation 两个月 开发出推理引擎 token speed 或英伟达利剑,在 nvidia blackwell 架构上性能优于 tensor rtlm。 八、浙大阿里提出 metacress 视觉 token 压缩,百分之九十精度不掉, 仅根据输入图像本身生成最优的压缩映设。团队在多格多轮视觉问答机制上,覆盖了多款主流 lvm 架构的不同规模模型, 针对多轮视觉问答场景下 l v l m s 的 视觉 token 压缩问题,提供了一套数据驱动的解决方案。