家人们,国产 ai deepsea 彻底的睁眼了!刚大范围开放了识图模式,所有的测试账号都可以免费体验,就在书框的旁边,一键就能开启。这可不是普通的图片识字,而是真正的能看懂图片 上传博物馆的文物。他能精准识别出清代乾隆时期的御器风格纹理,遇到烧脑的空间推理题,开启深度思考模式后,就能快速给出正确的答案。就连网红梗图、表情包,他都能精准的识别人物,读懂笑点, 网感直接拉满。打工人程序员更是狂喜,截图技术报告、网页界面,它都能一键提取文字,还能反向生成完整的 html 代码,就连网页的按钮都能原谅,复原效率直接拉满。更厉害的是,它的识图技术超级省算力, 同等图片处理消耗仅为 gpt cloud 的 十分之一,成本极低,性能却丝毫不逊色。不过目前也有小短板, 知识库更新稍慢,新款的数码产品容易识别出错。数图视觉类题目答案偶尔不稳定, 且仅支持图片理解,还不能深层图片解析视频。但是不得不说, deepsea 这次的实图升级,直接让国产多模态 ai 再上一层楼,好用又省钱,赶紧去试一下这个新功能吧,体验国产 ai 的 硬核实力!
粉丝1952获赞1.1万

deepsea 又更新了,终于可以识别图片了。这个更新看起来小,但我判断它会改写接下来一轮国内大模型的竞争节奏。 哎,你现在顺手点个关注,等 deepsea 把这事全量放开,市场会变得更有意思。大家好,我是杜宇,带你看懂 ai 赛道的前和事。有网友私信我说 deepsea 已经上线了识图模式,而且页面明确写着图片理解功能。内测中, 现在还是灰测。大家讨论了一整年的 deepsea 多模态终于开始从传说进入产品了。我本人呢,现在还没有被灰到,所以被灰到的朋友欢迎来留言区报个到, 顺手告诉我你测了什么图,速度怎么样?翻车没有?现在网上流出来的反馈很有意思啊。有人说它能直接上传图片做描述和分析,速度还挺快,体感接近 flesh。 也有人已经看到了入口,但一用就提示暂不可用,请稍后再试。更逗的是啊,连控制台里都有人扒到了 model type vision 这种字段,这就说明他不是网友自己拿不出来的 p 图整活产品入口已经埋进去了, 但真正值得了的,还不是他终于能看图了,而是这家公司后面准备往哪冲。我记得啊,在去年全网疯传的那篇梁文峰采访稿里讲的非常直白, deep 可压住三个方向, 数学和代码、多模态、自然语言。本身。这个表态很关键呢,因为很多公司嘴上说 agi 最后做成了流量入口或者功能拼盘。第四个讲的是底层路线,再看招聘信号就更清楚了。 之前他们放出来的研究方向里,已经就明牌写了 code math backbone model, 今年新一轮招聘又明显往 agent 产品化倾斜, tool, use, planning, 长期记忆多, agent 的 写作,自动化、工作流, 甚至多模态设备控制这些词都出来了。也就是说啊, deep tech 表面上是在补看图这块拼图底下真正想搭的很可能是多模态理解加推理加 agent 的 执行这一整套。哎,你再往前看, deep tech, v 四现在官方主打的是 v 四 pro 和 v 四 flash em 上下文已经铺开了,可官方的 api 更新日制,截至今天还没有公开。视觉模型这个节奏很 deep tech, 先把核心能力在小流量里磨顺,再决定什么时候把接口生态价格战一起打出去。那为什么他现在才做多母胎呢?很多人会觉得啊,字节腾讯百度早就做了 open ai, 更早 share gpd 出来之前就有了交易。 百度当年也是先推了文心义阁。所以在几年前我写 a i g c 智能创作时代那本书的时候啊,百度的 v p 写推荐语的时候提到的还是文心义阁,因为那会儿文心义眼还没出来呢。但 deepsea 走的压根不是功能先上车,流量先占坑的打法。 过去这两年干的事非常像一只丁胜率的硬核选手,先把所有资源攒在语言推理、数学代码这些更容易验证,能快速拉高模型上线的地方。这个策略其实很投资人,钱和算力都有限的时候,你得先打一条最陡最短、最能形成口碑反馈的路线。 三十六课之前有个闭门会观点,我觉得挺扎心的。多模态训练很贵,效果又未必立刻显著。现阶段智能的核心增量很大一部分还是在语言和推理里, deepsea 等于是先把最能出智商感的那部分卷到头,再回来补感官系统。所以他今天上识图,我反而觉得这是个信号,他对自己的文本和推理底座已经很有把握了。 最后说竞争影响,这才是重头戏。第一呢, deepsea 补上多门态之后,行业里最常见的一句吐槽就是他只会文本,要慢慢失效了。第二,一旦他把视觉理解和图表自动化、工作流这些高频场景就会被重新洗一遍。 第三,更狠的是价格带。 deepsea 以前最擅长干的事就是把大家觉得高端昂贵,只有头部能玩的能力打到一个非常有攻击性的成本区间。如果后面视觉能力也走这条路,国内的大厂就会很难受,因为原来能靠入口和产品矩阵去掉的利润,会被模型能力本身往下拉。 第四,他会逼所有的同行回答一个问题,就是你到底是在做一个会聊天的 app, 还是在做一个真正能理解世界,还能动手干活的模型系统? 这个问题接下来半年会越来越尖锐。所以我判断, deepsea 这次徽测表面上只是多了一个识图模式,实质上是在给下一阶段开门。 门后面大概率不是拍照问答这么简单,后面站着的是多模态数学代码 a 转化,还有它最擅长的那一套低成本高强度的推进方式。哎,你别小看这一步啊,很多时候,行业的拐点都是先从一个看起来不怎么炸裂的小入口开始的。点关注不迷路, ai 热点我带路,我是杜宇,咱们下期见!

deepsea 多模态识图模式上线网页和 app, 部分用户已经窥测到了网页和 app 中快速模式专家模式识图模式并列石头效果如何,请看分析。我把自己的一张照片发给他,他给我的分析报告不仅是识别,更有推理逻辑。一他盯着左下角的时间戳, 二零二五年十二月十日十八点二十六分,自己跟自己较劲。他说,如果这是真的,冬天的这个时候,天早该全黑了,可照片里天边还有晚霞。 他在用物理常识去推理,去质疑我看到的世界,这让我汗毛都竖起来了。二真正让我觉得恐怖的不是他的逻辑,而是他的眼睛。他突然指着图片顶部的天空区域告诉我,你看,这里有非常明显的 h u d 抬头显示或中控屏幕的倒影,可能显示着导航信息。 三甚至指着一个模糊的暗斑说,这可能是玻璃上的灰尘和污渍。我看了这么久的车,从没注意到这些细节。这已经不是识别了,这是比我自己的审视还要细致的审视。 所以, deepsea 的 识图模式到底强在哪?他不是简单的拍个照告诉你这是啥,而是用逻辑去推理,用超越人眼的观察力去审视。他看到了我忽略的世界,这就是多模态 ai 正在被打开的大门。关注我,价值翻译官帮你翻译价值,看清前沿 ai。

原以为最近 ai 疯狂更新已经告一段落了,没想到上周才发完 v 四的 deepsea 突然端出一个更大的惊喜。就在刚刚, deepsea 上线了实图模式,显示正在灰色中,这意味着讨论了一整年的 deepsea 多模态能力终于快来了。 deepsea 负责多模态的研究员陈小康在 x 上发文那 vcu, 并配上了一张图。 我刚试了一下 deepsea 那 个新出的实图模式,之前看陈小康在 x 上发那个金鱼睁眼,今天一看 app 里增多了个模式切换,就在快速和专家模式旁边 叫识图模式,标注着图片理解。内测中,我先传了一张特别复杂的餐厅手写菜单,上面还有图改和贴纸。说实话,我本来预期他能读出几个菜名就不错了,毕竟 ocr 嘛。之前用别的纯文本模型传图基本就是瞎猜,但这玩意儿居然把图改的部分也分析出来了, 说推荐菜从番茄牛腩改成了酸汤肥牛,可能是当日食材变化。这并非 ocr 文字提取,而是多模态识别,能够理解图像内容,分析场景,真在理解场景, 不是光读字。然后我又试了一张地铁线路图,问换成路径,他把十四乘十四那种分词厚的空间关系说的很清楚,不像有些模型直接给你乱编占名,当然也不是完美的。我传了一张一百兆出头的 p n g, 提示太大得压缩,官方说上限一百兆,但实际大图处理略慢,等了十几秒。 还有他后端那个微视模型,默认是关的,不能手动切。感觉灰度策略很保守,我朋友同样版本号就没有这个入口,另外就是纯视觉理解,别想着让它生成图。我 问根据这个海报风格生成类似的海报,他直接说不行,只给描述和元素拆解。这点 v 四技术报告里其实说过,目前就是挂载在 v 四主干的视觉模块,不是多模态生成。最让我惊喜的是图表解析,我扔了一张带情绪曲线和因果标注的用户调研折现图, 他居然说出了第四季度满意度下降,可能是因为客服响应时长增加,而不是产品功能问题。连情感和因果都推出来了。之前用别的 ocr 工具只能读出数字, 这个明显是视觉到语言到推理三层联动了,不过槽点也很具体,上传图片后如果打字太多,有时候会卡在理解中转圈的重新上传。还有他对中文手写体的识别,在那个菜单上还行,但换了一张医生处方直接就崩了,说部分文字无法辨认。这个倒是符合预期。整体感觉这不像一个正式发布的功能, 更像团队在秀肌肉,毕竟他们四月二十四号才发纯文本。 v 四这才过了五天就上了视觉理解,而且听说最近还有核心成员离职,这个节奏挺拼的。陈小康那个 now vcu 现在看来不是口号,是真的能看了。据我观察,这个灰度范围应该不大,官方也没说全量时间,但按照他们苏密变 no 的 节奏, 感觉近日就会扩大,想尝鲜的可以多刷刷 app, 如果看到模式切换栏有识图模式,但点进去提示暂不可用。别急,那就是被灰度到了,但还没开权限等推送就行,反正我的判断是纯文本已经卷不动了。接下来谁家的视觉理解能坐近推理链条,谁就有先手。 deepsea 这一步走得快,但开放节奏太磨了,赶紧全亮吧,别憋着了。

相信很多小伙伴们已经看到了他的 deepsea 上线了识图模式,那现在呢,大家可以用识图模式来识别很多的这个图片了,我第一个想到的就是,呃,先把我的一万张的这个,把我一万张的民国时期的照片先给他, 让它把每张照片做一个注示。很明显啊, ai 市场的又一次腥风血雨来到了 deepsea, 这一次它的石头模式上线之后呢,相信又有很多新的玩法,因为每一次 deepsea 重大的更新都会让很多的 ai 厂家 如坐针毡,那这一次它上线的石头功能又会带来怎么样的一个变化呢?未来的市场又会如何呢? 我们先不管这些,我们先用 deepsea 的 识图功能给我们带来实实在在的利益吧,那就是去解析你的图片,然后把你的图片给他带上注示,再发表在各个平台上面,让你的图片开始为你挣钱 啊。当然目前还只是部分的用户有这个识图,并不是所有的,所以你看一看你有没有。

终于轮到我了,今天打开 deepsea, 发现自己被灰度到了识图模式。 算下来,在主流多模态大模型赛道里, deepsea 其实算是最后一个补齐视觉能力的旗舰玩家。别人两年前就开始卷图像理解了,他今天才姗姗来迟。那问题就来了,这个识图模式到底是厚积薄发,还是单纯在补课呢?咱不说虚的,直接上难度,看看这双钢装上的新眼睛到底好不好用。 第一关,上海地铁线路图局部。先别说 ai 了,这张图咱们人眼看着都得蒙一下,线路密密麻麻,颜色交叉,站点名字又多,换乘点还挤在一起, 识别的非常的快。这波我得说,确实有点东西,大家注意啊,我给的是一张不完整的上海地铁局部截图,但它没有被局限住,而是先通过站点、线路颜色和换乘结构判断出这是上海地铁,再结合自己的世界知识补全缺失信息。 我看了一下,他识别出来的线路和颜色都对上了,连人民广场、世纪大道这种关键换成枢纽他也能拎出来。所以这一关不是简单的识别地铁图过关。他厉害的地方在于截图不完整,但他能先看懂局部,再用知识补全整体。 第二关,梵高的明画。这回不看逻辑看悟性,他能不能跳出这是幅画的表面理解去读懂这种抽象的语境? 好家伙,不仅叫出了名,连黄房子的透视、蓝墙、黄家具这些细节都点出来了,这就不只是认图,它是把艺术背景全串起来了,有点意思。 第三关,最狠的数学手写题。这张图其实还加了点难度,因为它本身有点弧,再加上是手写公式,符号又密,指数系数、括号都挤在一起,特别容易看错。我把它丢进去,看看 deepsea 能不能读明白, 整体表现还不错,大部分题干选项还有解析过程,他基本都读对了。但第一题这里有个小问题,他把四 x 的 指数 a 加 b 误识别成了 a 加 b 减三,也就是说他多读进去了一个 y 的 系数,导致这个地方识别偏了。 不过也得补一句, deepsea 这个识图模式是四月底刚上线的,目前还处在灰度测试阶段,能做到这个程度已经挺不错了,后面还是希望它越来越精准吧。 不过最有意思的是, deep seek 这次识图模式上线的同时,其实还同步发了一篇论文,叫 thinking with visual primitives, 即用视觉源语思考。 但现在这篇论文被 deep seek 主动隐藏了。我猜啊,可能是因为里面有一句暴论很伤竞品,它的意思是所有主流大模型在图像的拓扑、推理任务上表现都不行,等于把 open ai、 google arabic 这些模型厂商礼貌地全踩了一遍。 论文里还说, deep seek 的 拼方法可以用非常少的 token 数量就能完成视觉理解。同样处理一张八百乘八百的图片, deep seek 的 k v cash 占用就只有 gemini 的 百分之八,这真的是很厉害。 所以基于这篇论文,我们可以对下一代 deep seek 的 原生多模态能力给予很高的期待。小结一下上面几期视频,我聊到 deep seek v 四的时候,还说它不支持多模态是很遗憾的, 结果才过了一周多,他直接把这块补上了,这个速度真的可以说一句为中国速度点赞。好啦,我们是只做硬核实测的,碳基生物退役指南,下期见。

deepsea 新上线的识图模式你玩到了吗?大部分人都没被窥肚到,有个高赞回答聊了点深层的,这个识图模式到底是不是 deepsea? v 四回答推断可能不是,因为 v 四 preview 版完全没有提多模态,如果是文本模型外挂视觉模块意义不大。 如果是 v 四原生支持多模态,那 deep six 藏得够深。有意思的是,网友用同一个提示词提胡骑自行车测试识途模式,深沉的 svg 效果明显比 v 四 pro 好, 这说明它很可能是一个独立的还在微调的多模态模型。 为什么单独做这个回答举了个例子,自动识别小票照片里的金额,不用手工录入。这就是多模态对 a 站产能力的加成。人类大部分交互依赖视觉,没有多模态, a 站产能力大打折扣。总结, 这个识图模式大概率是一个独立的多模态模型, deep six 阶段专注做好多模态输入就已经很有竞争力了。你觉得识图模式会是 v 四的一部分吗?评论区聊。

就第一天我就把 deepsea 给测爆了,就是我拿我的有过笔记的书,然后喂进去,嗯,大概是九十万字左右,我希望他能把这个 pdf 完全给吃透嘛, 然后就出发了,他上下文上线的一个窗口,他单次处理的文字只有八千字左右,所以我很快就摸到了 deepsea 文字处理的上限,所以大家以后喂给他文字的话,注意 你的 pdf 的 上下文的一个时长。然后这个问题我处理完之后我就想了解说,因为我有一个习惯,就是我会定期的截图,近七天抖音全部涨粉人群的一个数据,这个数据在你的创作者后台是可以看到的, 从前的话这是一张截图便有了解大概什么样的类目能够涨粉,什么样的类目是现在比较受欢迎的。 然后今天我就会把这个截图喂给 tipsik, 让它来帮我呃,理解设置当中的一个数据跟答案涨粉的一个比例,然后这里有结论给到大家,大家可以看一下,就是如果做上面内容是有可能涨粉的,我多问了一句,怎么样在合规的情况下进行剧烈的涨粉,对吧?所以上面的答案大家可以参考一下。 第三个就是我平常有非常多的收藏苹果任何文档跟图片的能力,就是苹果的任何的物料,我觉得大家都应该好好的去学习一下,包括它的详情页, 我现在还存着它,呃, iphone 十一的详情页,它的详情页,它的微信公众号的推文,它的短视频的封面,包括它短视频的设计,这里面有很多很多可以学的地方,然后我就给到一张, 呃,我当时收藏了 iphone 十七 e 的 图片,还有今天他呃 iphone 里的假期搭子的推文给到 deepsea, 然后让他提取提示词,让呃吉梦跟不同的模型来生图。大家看已经非常可用了,尤其是基地做的这张 iphone 十七 e 是 衍生而来的 iphone 十七的海报,可用度非常的高,所以 接下来的话,大家要记得就是囤好自己的图片性的语料的信息,标注好自己图片性语料的信息,然后不光光只是文字,对吧?咱们就可以多为一些语料给到 deepsea 这里造成的影响我觉得应该是非常深远的,不知道你们有没有,就是打开 你们的手机的这个地方,会有一个识图的模式,然后测试最新的 deepsea 微四的一个模型,它带来的改变是因为呃纯文字文本的一个输入呢,它逻辑是有限的, 因为文字的话你可以罗列一二三四,一点一,一点二,二点一,对吧?但你在写其中一是个分类的小点的时候呢, 你很难再考虑到更多的逻辑关系在里面,但是图的话,它可以表达的逻辑关系和信息量是非常大的,所以 ppt 它的信息含量是比一般的文档要高很多,因为它可以展示结构,对吧?所以就是如果 deepsea 它可以支持图片输入的话,就意味着大家免费能用的模型 却有了一个能力上的一个提升,对所有人来说都是件非常好的事情。然后我今天第一天就把这个测爆了,朋友。嗯,好,我们下次再见。

tipsy 长眼睛了,大家期待的 tipsy 多模态可能就要来了。就在昨天, tipsy 又添加了一个识图的模式,没有发布会,就这样悄悄的灰度测试了,只有他们多模态负责人发的一个意不明的一个预告, 所以我赶紧试了一下,我直接把这个预告截图发给了 tipsy, 我 问他发了这个动态是何意味啊?他分析拆解,得出了几个结论,一,这个是官方的重大的预告, 二是说明 deepsea 已经有了原生多模态的大模型了。然后我又给他进行了一个经典的数手指的测试,结果就是测试是通过的,并且推断这个图是 ai 生成的。然后我发现他的推理过程其实挺有意思的,他先是认真的数了一遍,一二三四五,然后,嗯, 好像哪里不对,然后又重新数了确认了一遍,还好最后是数对了,还可以嘛。不过话说回来,从目前的灰度截图来看, 识图模式更像是一种图片理解,而不是原生态的多模态的生成,它可以看图理解图片,回答图片相关的问题,但它还没有具备图像生成、视频理解或者更复杂的跨模态的生成能力。所以更合理的判断是, deepsea 先在 v 四主干之外 接入了一个视觉理解的模块,让模块具备了看见的能力。所以大家有没有试一试它的识图功能?你们觉得好用吗?

老铁们啊,今天这期视频呢,我要给你们唠一个炸裂的事啊,就是大鲸鱼终于把眼罩给摘掉了。这回的 deepsea 呢,又出了一个狠活,这次的识图功能,直接把压缩比干到了七千零五十六倍。你没听错啊,是七千零五十六倍, 这是啥概念呢?就像你家的宽带,跑满一年不如人家一个响指的时间, gpt 五点四呢,不好意思,就是被按在地上狠狠的摩擦,不服呢你就往下看, 我跟你们说啊,这个七千零五十六倍的压缩啊,他不是吹出来的,这是实打实的技术突破。啥叫压缩比呢?你可以理解为 ai 处理一张图片需要消耗多少脑细胞, 传统模式呢,就是吭哧吭哧的整半天啊,最后呢,累够呛。 deepsea 微四呢,轻轻眼睛一瞟,懂了七千五零五十六倍是个啥概念呢?就是说以前 g p t 五点四处理一张复杂的图片要消耗的资源, deepsea 微四只需要七千分之一,这不是挤牙膏啊,这是直接把牙膏厂给收购了。 老铁们啊,你品一品七千多倍的差距,这已经不是跑步了,这直接给你发了火箭。好,咱再聊一聊这个 gpt 五点四,这个老大哥啊,之前 deepsea v 三刚出来的时候, gpt 呢,还是稳坐钓鱼台,在他的眼中, v 三就是个例子,结果 v 四一面试直接就翻天了。 你看这个对比推理速度, deepsea v 四快了将近二十倍。准确说, deepsea v 四在复杂场景的理解上,它是领先的,压缩比七千零五十六倍碾压级别, 只带理解,这是最狠的啊!咱们下面会细说 gbt 五点四,现在心情大概就是,我不要面子吗?你让我的脸往哪放? v 四,你要掀桌子吗?但是没办法,数据呢,就摆在这, deepsea v 四呢,就是更强, 接下来这个概念呢,才是今天的重头戏啊,叫纸带红勾,啥意思呢?老铁们,我给你们举个例子,你给 ai 一 张图,图片里有十个人,然后你说就是那个穿红衣服的男的。普通 ai 的 反应就会歪着脑袋问你,你指的是哪一个?你说的是那个吗? 这几个男的都穿衣服了,这就是纸带红勾啊。 ai, 他 听不懂人话,你以为你说明白了? ai 呢,是一脸蒙圈,这就是人机交互里面最大的 bug, 但是 deepsea 微四直接把这个红狗给填平了。现在你再说那个穿红衣服的戴眼镜的男的, deepsea 微四呢,直接给你精准定位,就是他 指哪打哪,弹无虚发。好,说了这么多呢,咱来点实际的场景,一,你去参加婚礼,拍了一张大合照,二十多个人,你问 ai 第三排左手第四个人是谁? deepsea 微四直接给你指出来,你截一张电影图, 呃,问这个人是谁,他旁边的那个人又是谁? ai 呢,也会秒回答,呃,比如说你有一张产品图,有一堆产品,你让 ai 呢,帮你找到那个带蓝色标签的小圆盒子, 对不对? v 四呢,也会精准的定位一个,不差以前的这些活呢, gpt 得琢磨半天,呃,还可能是回答错误,现在对不对? v 四,说,干就干,稳准狠。你们还记得之前那个神鬼二象图吗? ai 界一直有个争论,争论啊,就说到底 ai 是 神还是 ai 是 鬼? 现在的 deepsea 微四用实力告诉你,他是弄那个能把神和鬼都给你整明白的神仙!老铁们啊,今天这期视频呢,信息量有点大,七千零五十六倍的压缩比,超越了 g gpt 五点四 突破纸带红沟,这三板斧下去, ai 圈的格局啊,就直接就改变了。你们觉得这个 deepsea 微四牛不牛?你要觉得牛的,你就扣个六六六,你还觉得 gpt 还能打的,你就扣个不服? 你想看更多的 ai 评测视频呢,你就扣个催更视频呢!觉得有用的话,你就给我点个赞,转发给更多玩 ai 的 朋友啊!我是老街,咱们下期见,记得点赞关注哦!

如何抓住 deep seek 识图模式带来的技术红利?看完视频直接上路!就在今天五月九日, deep seek 发布识图模式,这是彻底睁眼了。这意味着从今天起,他不仅能看懂图片,还能像人一样去思考和推理。一、 这个识图模式到底强在哪?对我们普通来说意味着什么?二、咱们又该怎么借助它来搞钱呢?一个视频给你解个透,在开始前先放个深水炸弹。我们推出了警护 o p c 社区,只在聚集更多艺人、公司、创业者,感兴趣的朋友留下 o p c 三个字母。 现在开始。一、这个识图模式到底强在哪?对我们普通来说意味着什么?简单来说,他不再是简单的文字识别工具,而是一个全能的视觉助手。你拍一张博物馆文物的照片,他不仅能认出这是什么,甚至能告诉你他属于清代乾隆时期的哪种风 格。你遇到一道烧脑的空间逻辑题,他能像学霸一样在脑海里慢慢推演,最后给你正确答案。甚至是你随手截的一张满是代码的网页图, 它能直接帮你还原成可交互的 html 代码。这就好比给你的大脑装了一双透视眼,工作、学习、生活里的难题,拍个照就能解决。二、咱们又该怎么借助它来搞钱呢? 在这里给大家三条业务路径,一、做电商卖家的眼睛。很多中小卖家根本没时间去做竞品分析,你可以帮他们做,拍下竞争对手的主图和买家评价,扔给 d c, 让他总结出对方的优劣势和买家痛点。你把这些信息整理成一份报告,一份就收个几百块,一天做几单,收益也很可观。 二、做普通人的合同翻译官。很多人租房签合同,面对密密麻麻的条款,头都大了。你用手机拍下合同关键页,让 d c 用大白话解释每一条,并标出潜在的风险点。你提供这种避坑指南服务,不需要律师资质,只是做信息整理,就能帮人解决大麻烦,赚取服务费。 三、做内容创作者的灵感图,但写不出吸引人的小红书,却想不出好的配文。你可以直接把图发给 d c, 让它生成多版本的种草文案,你再稍微润色一下,交付给客户。以前沟通半天都说不清楚的需求,现在几分钟就能搞定。点赞、收藏加关注,请护前沿管世界,前沿在线带你抓住时代红利!

我刚试了 dpxckey 这个新功能,说实话有点吓到我了。它现在在内测一个识图模式,不是那种普通识别,是你直接甩一张图过去,它就能帮你分析理解,甚至一步步教你怎么做。我拿合同界面商品图全试了一遍,基本上能看懂还能给建议。 以前是我教 ai, 现在变成 ai, 看一眼就教我。这玩意一旦全面开放,很多行业真的要变天了。你觉得最先被替代的会是谁?

deepseek 刚更新了一个多模态识图模式,我被拉进灰测,第一反应是能有多强。我用同一张界面截图,分别让 deepseek 和 gpt 四 pro 生成 svg 代码, 结果 deepseek 的 输出布局还原度高,代码干净,几乎没有溶于标签。 gpt 四 pro 那 张细节更丰富,但 svg 结构明显更复杂,渲染负担更大。 客观说,如果你要的是轻量级加载快的 svg, deepseek 这波赢了。如果你要的是极致细节, gpt 四 pro 还是有优势,但关键是 deepseek 上下文是 em, 生成速度也更快。 识途模式的赛道现在不只有 gpt 了,国产工具这次真的追上来了。

deepsea 终于开眼了!那个被全网催了一整年多模态能力的国服盲僧 deepsea, 昨天晚上终于舍得把眼罩摘下来了。就在大家还在消化非四大降价的消息时, deepsea 突然在网页端和 app 端恢复上线了识图模式。可以看到,输入框上方除了原有的快速模式、专家模式,多了一个全新的识图模式按钮,标注着图片理解功能。内测中 上传一张图片,他就能分析内容,识别细节,告诉你图片里有什么。我们火速实测了一波,让他找不同。两幅海绵宝宝剧照,他指出的几处差异基本靠谱。虽然派大星的眉毛在我看来没啥区别,问他这是哪家店的咖啡,他能认出是网红店二三三,但具体位置就答不上来了。因为他的识图功能不联网, 全靠知识库,遇到太新或太具体的信息就假磕给他一张鼓包的充电宝,他能准确识别并分析安全隐患,表现很稳。最后上了一张把其他爱绕晕的刁钻梗图,他虽然分析的头头是道,但最终也没答对,看来是真的被难住了。 总的来说,他的初亮相能看懂,但看的不够深,逻辑分析是亮点,精确识别是短板,像一个认真但有时会跑偏的学霸。目前这一功能还只是小范围测试,很多用户点进去还是会提示暂不可用。 deepseek 上线的多模态能力终于补齐了,视觉理解这块拼图虽然现在只是前菜,但明显是在为更强大的多模态大招铺路。大家有什么图想考考 deepseek 吗?