如果你想用好 ai, 不 被他忽悠敷衍,那这条视频一定可以帮到你。第一条,防止模型阿谀奉承。顺着你说,明确告诉模型,请不要迎合用户的任何立场、观点、假设,把我认为改成有人认为 心理素质强大,甚至可以事事改成我讨厌的人认为。第二条,防止 ai 幻觉胡编乱造。 实时要求 ai 请根据已有资料回答。在提供所有其他事实以及推论时引入外部链接以及可验证来源,不知道时便说不知道。如果比较了解模型的,可以实时引入 r a g 检测和 c o t 链式思维。 第三条,防止 ai 假装自信。实时要求模型在输出后面提供一个知性度评分,比如零到百分之百,并且提供多角度不同解释。 当他被强制要求列出多个选项时,你就能看到他实际有多大把握。第四条,防止被问题本身带偏。要求模型找出你问题中的隐含假设,并对假设做压力测试。如果有问题,先向你提问题再做回答。 好,今天先分享这四条,如果想要完整版防忽悠指南,请私信我领取,谢谢大家看到这里了,下次再见!
粉丝1.5万获赞18.5万

用 ai 开发复杂任务,有时候容易出现幻觉,或者说出现虚构,是指模型生成的内容看起来很合理,但其实是错的,是模型编造的,而且大模型说出话时候的语气跟说对时一模一样,这就很可怕。 在写代码时容易出现的幻觉场景有这么几种常见的形态,第一是编造 api, 比如 啊楼大十点底部可能 fast, 但这个函数其实是根本不存在的。第二是编造一个依赖路径,有些看着很合理的路径,但其实也不存在。第三是版本错配,比如 ai 所位于三点四 u 微软 mod, 但其实微软 mod 出现在三点六中 啊。第四完成度续报啊。他说已经修复完 ui 卡顿的问题,但大魔性并没有真正启动浏览器去验证,他只是觉得应该是修复了。第五是萨贝 a 总裁自爆了一个完成了某某任务,但其实他只做了一半,他自己总结是给美化了。 那为什么会出现这些幻觉呢?大模型他是按照概率去预测,陀螺坑遇到不知道的事,他倾向于不一个最像的,而不是停下来说不知道。训练数据里这类的 api 或者是版本键多了,他就觉得概率上应该是这样的,但我们的代码仓库里可能并不是这样, 而且复杂任务可能会积累。第二步,一个小的幻觉,等到第七步,可能就是一个方向上的差别,那应该怎么预防呢?首先是写 problem 的 时候,要写相对准确的描述,这样能极大减少出现幻觉的概率。 一个好的 problem 呢,等于明确的事实加明确的边界,加明确的允许,不知道加可验证的输出格式 如何给 ai 明确的事实?我举一个例子,比如说用 cloud code 修改一个 bug, 不要简单的说这个错误帮我修改一下,而应该说我点击某个按钮的时候没有达到什么样的预期公式来报错信息是什么?最好把这个报错信息粘贴给他,把问题描述清楚,也把预期说清楚,不要让 ai 去猜 如何给 ai 划清边界,我举个例子,比如说修改某个分页 boss 问题,就告诉他不要重勾,不要重命名,不要顺手优化别的内容,当然可能好的模型也不需要这么复杂的建立边界。 如何给 ai 所不知道的台阶?我举个例子,比如说要问 on the data 某个版本有没有某个特性,最好是这样说, on the data 四点二版本,这不是是某个特性,如果不确定就说不确定,不要根据相应版本去预测, 哎。第二种预防幻觉的方法是把一些反幻觉的文档写进 cloud 的 md 中,比如记录一些重要的反知识点, cloud code 每次开启新的对话都会去读者考的 md 文档,这样就可以避免很多幻觉。上面我说的这些预防的方案,但其实最主要的还是要人工去审核 ai 生产的代码,当项目出现问题的时候, ai 永远不会给你背过,人永远都是第一责任人。


面试官问,你们是如何保证 agent 的 工具调用不被模型的幻觉带偏的?这背后其实藏着大量生产级的踩坑经验。今天我将和大家一起复盘,我们团队是如何解决这个问题的?在面试大模型应用开发岗位时,我特别喜欢问这个问题,你们是怎么做 agent 的 工具调用的? 大部分后人会提到 function、 calling、 结构化输出、 prompt 优化这些关键词。这些回答本身没错,但它们只触及了表面。在真实的生产环境中,工具调用的挑战远比这复杂和残酷。为什么说这些回答太浅,因为在真实世界里,仅仅依靠 prompt 来约束模型是远远不够的。 我们遇到过各种问题,模型忘了传、参数生成的 jason 格式不对,甚至在用户没要求的情况下,自己脑补着去调用工具。这些问题在实验室里可能不明显,但在生产环境中,任何一个小失误都可能导致严重的后果。 我给大家讲一个真实的故事,就在上个季度,我们有一个金融分析 agent 的 上线。有一次用户只是问了某只股票的历史数据,结果模型可能是看多了交易相关的例子,产生了幻觉,自己脑补着调用了股票交易接口, 虽然只是模拟盘,但也差点触发了风控告警,把我们吓得不轻。这件事让我们下定决心,必须建立一套独立于 l、 l m 之外的更可靠的安全防护机制。吃一堑长一智。经过这次事件,我们团队痛定思痛设计并实施了一套三层防护网方案。 这套方案覆盖了从用户意图识别到工具调用结果返回的全链路,只在从根本上杜绝因模型幻觉导致的调用事故。接下来我将为大家详细拆解这三层防护。 第一层防护我们称之为意图防火墙。核心思想很简单,不要让大模型自己去猜用户想不想调用工具。我们在流程最前端加了一个轻量级的小模型,专门做意图识别。只有当他判断用户确实想调用某个工具时,我们才会让请求进入工具调用流程。 这一步非常有效,直接砍掉了超过百分之四十的物触发,而且成本极低。第二层防护是强制 sigma 校验,我们不再用自然语言去描述参数要求,而是直接上 jason sigma。 这就像给工具调用定了一个严格的器约 模型生成的。这层必须严格遵守这个协议,自断类型、取值范围、必选参数,一个都不能少。如果校验失败,我们就把错误扔回去,让它重做。这一招非常狠,直接让参数错误率降低了百分之九十九。第三层也是我们发现最关键的一层,叫做结果自洽性检查。工具调用成功了,不代表万事大吉, 我们会把用户的问题、调用的参数和返回的结果打包在一起,让另一个 l m 去做个质检员,评估这次调用合不合理,结果能不能回答问题。 这一步能过滤掉很多模型瞎忙或一通但答非所问的情况,让最终的答案质量大大提升。这三版斧下来,效果是立竿见影的,我们的 agent 工具调用成功率从原来的百分之八十五直接干到了百分之九十九点五。更重要的是,线上因为模型幻觉导致的调用事故直接清零, 用户满意度也得到了显著提升。这证明了好的工程实践能让 ai 的 能力发挥得更稳定、更可靠。回到面试的场景, 如果一个后人在聊工具调用时,能主动提到这些分层叫验的思想,比如前置意图识别、 scanma 叫验或者结果评估,我基本就知道他是做过真东西的。这说明他不仅懂模型,更懂如何将模型能力工程化,确保其在真实世界中稳定运行。

嘿,你有没有这种感觉, ai 变成最大的坑,不是 ai 不 够聪明,是它记不住事儿。今天老韩就给大家分享压箱底的神奇项目, cloud m e m, 彻底解决大模型借冒失忆的毛病。 这个视频分三部分,第一部分直接给大家上教程,秒安装解决问题。第二部分总结当前关于大模型失忆的关键几个问题。第三部分是总结当前主流的解决方法的几个流派,学完后呢,是可以在朋友面前嘚瑟的那种。 先说第一部分怎么装,如果你没有时间懒得学,直接看这一部分,按我的安装教程走就行,喝杯咖啡的时间就搞定,让你告别 ai 断片的各种烦恼。我把所有的操作步骤写进了教程里, 我还替你跑完了全流程,全流程只需要你手动做三件事,第一个,把教程文档给到大模型。第二,把安装命令复制到你的端里回车,在弹出来的界面选择你的 id 工具空格选择回车确认就行。第三个,把你的大模型 api k 填进去, 其他的配置、环境检查、文件创建、啪嗒修复,全部交给大模型自动搞定,你不用管。装完之后你怎么验证呢?两个地方看一下,第一,打开记忆面板的网页,能看到上下文正常输出就说明他跑通了。第二个,新开一个 cologne code 的 窗口,如果之前的绘画记忆自动加载进来,颜色还分了级,重要的标红,一般的标黑,那就证明没问题。 老韩把完整的安装教程文档已经打包好,先收藏这条给到大模型,让他直接按照流程走,按照教程走就行。好了,装完的朋友,恭喜你,记忆问题已经解决了。第二部分,如果你想知道大模型关于记忆的那些让人纠结的问题到底是什么,那就接着往下看, 大魔性的记忆到底有什么毛病呢?脑海总结有四个,第一个,鲸鱼脑上下纹有限,塞不下了就失忆呗。第二,断片王高德扣的,每重启一次,大部分记忆全没。第三,跑偏,经常任务做着做着目标就漂移,同样的 bug 会反复犯。第四,各干各的, 多个 a j 的 没有共享大脑,互相拆台,并且还有越界改代码。这四个毛病你遇到几个?是不是有点意思?第三部分,如果你想在朋友面前装一装,就得懂得当前解决记忆问题的几个流派,市面上主流的有六大门派。第一个叫小纸条,代表的就是你, 代表就是你自己写的 cloudy 点 mb。 优点是原生缺陷高,每次绘画都会读。缺点就得手动维护,信息多了等于没写 ai, 也不会老老实实执行。 这个老韩在之前的第一期的教学文档里面有具体的介绍,大家可以翻一翻。第二个草稿纸,代表是一个叫 p w f 的 项目,后续老韩也会给大家推荐。优点是能解决任务飘移和上下文易除。缺点是手动加载管理麻烦。 第三个,外挂硬盘,代表是 m e m 零 super memory, 这些。优点是自动化,长期记忆容量大。缺点是额外部署维护解锁不准选,还延迟高。第四个呢,叫共享大脑,代表是 w p h f, high cloud 等这些项目。 优点是团队的知识可以敷用。缺点是维护成本高,个人小开发者暂时不用理会。第五个叫大管家,代表的是 l e p p a, 优点是 ai 判断如何级最像人类,缺点是复杂不稳定。 第六个就是老韩主推的特战插电,代表 cloud m e m。 它干的事很粗暴,自动获取上下文压缩存到本地,新绘画自自动注入, 流程简单,全程自动丝滑体验肉眼可见。你把它理解成是给 ai 配了一个小助理就行,你每次跟 ai 聊完,它自动把对话压缩成栽,要存下来,下次开新窗口,助理先递上一份。上次, 上次聊到哪里了, ai 立马进入状态。好了,先截图保存,没事给朋友们先装一装。是不是有点意思?有个细节也得提醒一下, ko 的 mem 每次升级会覆盖那 passcode 文件,升级后记得重新跑一遍。 passcode 这个脚本我也在教程里面写了进去, 反正就一句话的事,如果你苦大模型蓄意已久,评论区聊聊,咱们下期聊点更狠的,关于开发大工程,你不得不用的几个工具和方法。我是老韩,咱们下期见。

备考大模型面试的小伙伴注意了,被面试官问到多模大模型的幻觉问题是不是更严重?视觉幻觉该怎么缓解?今天教你面试专用精简干货,直接背就能得分,开口就能答。首先,统一核心认知,多模大模型的幻觉问题 确实比纯文本模型更突出,这是行业公认的结论。面试官之所以常问这道题,核心就是考察你对多模态整体系统复杂性的理解深度。那么接下来咱们拆解清楚逻辑。首先,为什么多模态幻觉更容易出现也更严重?多模态本身是视觉编码加跨模态对齐的双模块串联结构,任意一个环节出错都会层层放大,直接 形成视觉幻觉传播链。先是视觉编码器容易识别出错,很常见的例子就是把米色连衣裙误识别成白色半身裙,紧接着跨模态对齐印刷,跟着出错。模型会基于错误的视觉特征,凭空编造图片里根本没有的细节,比如说裙 子带有蕾丝花边,但原图里完全不存在这类元素。接着讲解缓解视觉幻觉的分成方法,整体分成训练、推理两个阶段。训练阶段从源头根治错误,重点优化跨模态对齐策略。最关键的落地手段就是 专门构造大量普文不匹配的样本做训练,让模型学会主动甄别,敢于表达途中没有对应内容,从源头减少编造行 为。推理阶段,工程落地最实用方案,行业主流做法就是双模型交叉验证,到二零二五年已经成为多模态落地应用的标配方案,具体流程也很好理解。第一步,由多模态大模型根据图片生成文本描述。第二步,调用专业的视觉检测模型,回头重新校验原图。 第三步,逐一核验描述里的颜色、款式、材质等关键信息,确认是否真实存在于画面,剔除凭空编造的幻觉内容。最后给大家总结面试核心口诀, 直接背动态幻觉更易发,双模块串联易偏差训练空数据强对齐推理双验易幻觉,硬核干货持续更新中,还有哪些想要了解的问题可以评论区交流!关注我,每天一道大模型面试专题,带你轻松拿大厂 offer!

兄弟们,今天面试一个候选人,简历上写着,精通 r a g, 熟练掌握 agent 开发。我就问了一个问题,你做的 r a g。 应用怎么控制幻觉?他答,增加上下文,提升模型温度。我当时就笑了。 这是一个非常典型的场景,很多候选人对技术的理解停留在表面,当被问到深入问题时,回答往往是错误的,或者答非所问,这暴露了他们缺乏对底层原理和工程实践的真正理解。 我们看到市场上充满了 api 调用工程师,但企业需要的是能够构建稳定可靠、高性能系统的系统设计师。这种认知上的错位是导致面试通过率低的主要原因之一。 接下来,我将分享几个我们团队在实际项目中遇到的差点造成重大损失的真实案例,这些案例所反映出的问题才是我们在面试中真正考察的重点。很多人认为 r e g。 的 关键在于召回率,但实际上,在保证一定召回率的前提下,如何控制模型产生幻觉,才是决定一个 r e g。 应用能否上线的核心。 我们曾经有一个项目,因为幻觉问题差点导致严重的业务风险。我们的解决方案分为几步,首先是上下文重排,这就像给模型一个更清晰的阅读顺序。 其次是事实较验,相当于给模型的回答加上一个审核员,确保关键信息的准确误误。最后一步是动态路由,我们不能对所有问题都使用同样的处理方式, 对于简单问题,直接回答效率更高。只有复杂问题才需要动用 r e g 甚至 a j。 的 这样的重型武器,这体现了系统设计的灵活性和工程化思维。这张图直观的展示了我们是如何通过深度学习模型来对照回的文档进行金牌的。 通过这种方式,我们能确保模型在生成答案时优先关注最相关的信息,从而有效控制幻觉。接下来谈谈 agent。 很多人对 agent 的 理解太肤浅了,以为只是让模型去调用工具。 但在生产环境中,一个 agent 执行的任务可能非常复杂和耗时,如果没有良好的状态管理,一次小小的网络波动就可能导致整个任务失败,用户体验极差。我们的解决方案是引入 checkpoint 机制,简单来说,就是在 agent 执行任务的关键节点自动保存游戏存档, 一旦出现问题,系统可以读取最近的存档,让任务继续进行,而不是从头再来。这极大地提升了系统的见状性和用户体验。 这张状态地图很好地全释了 checkpoint 原理。 agent 的 工作流被分解成一个个离散的状态,我们可以在每个状态转换成功后保存 checkpoint。 这样无论在哪一步出错,我们都能精准地回到上一个稳定状态,实现无缝恢复。 最后一点,也是最容易被忽视的一点,并发症与异常处理一个功能在本地跑通 demo 很 简单,但要让它在真实的高病房环境下稳定运行完全是另一回事, 这是区分玩具和产品的关键。我们曾经因为一次流量红风被 api 服务商拉黑,这个教训让我们建立了一套完整的并发症控制体系。通过异步化、速度限制和溶断降级,我们确保了系统在高负荷下的稳定性和弹性。 这张覆盖均衡图展示了流量控制的核心思想。在我们的系统中,我们不仅对外部 a p i 进行限流,内部服务之间也采用了类似的机制,确保整个系统的流量处于可控状态,避免任何单点故障导致整个系统崩溃。 总结一下,大模型应用开发已经进入了下半场,单纯会调用 a p i 已经远远不够,企业更看重的是你的系统设计能力、工程化思维和解决复杂问题的实战经验。希望今天的分享能给大家带来一些启发。

今天我用 curl code 帮我做一个中等以上需求的一个需求说明书,考虑到 curl 的 像大模型都是一个注意力机制的这么一个大模型,那我可能我的第一步就是在 tst 里边先把整个需求的背景,包括需求的功能点,包括让它呃要设计的一个注意注意要点,然后包括我对这个需求的整体的一个理解,把它呃列举成一二三。然后我在 tst 文档里边 梳理一下整个需求,然后就让 clark called 帮我做做一个详细的设设计说明书,然后他做完做完出来之后,他给我设计的相关的表结构,然后接口说明文档,包括还有时序图,包括还有那个注意事项,甚至还有一些测试的案例。 那设计完了之后,我就会对整个文档做了一个呃快速的呃浏览之后发现它里边其实还有一些设计的点比比较粗,比如说有一些定时任务,它可能是就默认了就每五分钟执行一次,但是它和实际的那个 呃时间是有冲突的。比如说我定时计划是一个随机的九点十三分来执行一个任务,如果他每五分钟来执行一次的话,他在极端情况之下,他可能会在九点十七分才会执行到我九点十三分的一个任务,那在这种情况之下就会造成那个任务的延时, 所以我就让他,我说,我就让他呃做任务的一个前置,然后再呃单独再做一个派发的任务,那就显显著的降低了这个任务的 呃时效性。然后在关于这个 clock code 帮我设计的需求说明书,他也是不断地在从事啊,不断地在迭代,然后最终把这个设设计说明书呃给出出来 啊,最终呢,有一点就是因为它设计说说明书里边本来我已经配置了很多的呃本,本来我已经配置了基本的 clock code 点 m d, 包括 enigma 点 m d。 在 这个不断的对话的过程中,因为这个需求的文档在不断的迭代,也触发了它好几次的那个压缩机制。 所以我觉得就是有一个技巧,就是当你把那个设计说明书如果说多次绘画呃到一定程度的时候,可以执行一下杠 clear 来,嗯,把那个上下文给清空一下,然后再基于它现在生成的那个文档来继续来生对文档进行处理,这样可能 呃让这个自然理更聪明,不会让它产生幻觉。呃,我从这个计划说明书的这个实践过程中,我觉得 clockcode 呃做设计说明,然后再让 呃,比如说 ctrl 或者是去来编编辑代码会更加的呃快速和有效。你们觉得呢?欢迎评论留言。

a i 会撒谎, a i 说太阳绕地球转,不是他故意说谎,而是基因里的三大缺陷。一、鹦鹉学舌,他的大脑是概率计算器,语法完美不等于事实正确。二、被迫营业,就算不知道,也得从词库调个最像答案的词。三、模糊记忆,知识压缩成参数碎片,低频信息靠脑补。 四、垃圾进,垃圾出,互联网百分之三十的信息本身就有错误。五、过时记忆训练截止二零二四年,二零二六年的新法规,他根本没见过。六、压缩时真常对话,像传话游戏,每三百字就跑偏一次。七、角色绑架, 你让他当无所不知助手,他就硬着头皮编,让我们来用 easy 破解幻觉。一、 rap 解锁,先查官网再回答,法条对错一目了然。二、实时联网,知识截止,直接调用二零二十轮自动重置,拒绝信息污染。四、多模型切换, clubpos 加 gpt。 五、加 kimi, 专业领域精准打击外贸公司用 ezclub 自动处理三千份订单,跨境电商团队靠 ai 客服二十四小时接咨询,这才是 ai 的 正确打开方式。 ezclub 让 ai 告别幻觉,你的时间值得被精准守护。

hello, 同学们,大家好,那我们今天呢是给大家讲一下我们这个 aint 开发应用面试当中经常会问的一面试官经常会问的一个问题,就是大模型为什么会产生幻觉?那我们生产当中呢,怎么去解决这个幻觉问题?首先呢第一点呢就是说什么是幻觉? 那我们经常大家有比如说平时在用一些豆包啊,或者 deepsea 的 时候,他会发现他说的一些结论啊,或者这些东西都是 在一本正经的胡说八道,那为什么会产生这种我们所感觉到的这种胡说八道?他明明不知道还在瞎讲,那这其实就是大模型的这个幻觉, 为什么呢?我们知道大模型他是训练,他是相当于是之前经过很多参数的,他回答的所有问题呢,在没有你外部知识辅助的话,他都是按照他之前训练的参数进行回答,那这些参数呢?可能是呃几个月之前的了,所以呢或者说他压根就不知道这些东西,那所以呢他会找这一些幻觉, 那比如说他游戏会是会去瞎编一些,捏造一些东西,他其实大模型本质呢就是一个呃概率的推理模型,但他不知道的时候他就会瞎说。那比如说我们举个简单,你比如说问你问他 民法典的毛衣毛条,如果他在训练的时候没有把这个民法典的这个数据放到他的参数里面去,那他肯定是不知道,他就在瞎说, 那还有呢一些逻辑上的幻觉,那我们刚才讲的这种啊,他是不知道瞎说是事实幻觉,还有种叫逻辑幻觉,就是他多步推理之后,哎,一些上下文丢失了, 然后会导致他一些在瞎说的一些问题,比如说我做数学题第一步对了,第二步错了,但是呢他还跟你一些稀里糊涂的一些结论,这个呢就和他做 逻辑幻觉,这个幻觉呢,其实呢不是它的 bug, 是 大模型,它的从底层原理就决定它会产生那些问题,就是一些已知的一些缺陷,固有的缺陷改变不了, 那我们要做的什么呢?是要去把它,就是呃把它进行一个控制,在有效范围进行控制,那我们在实际工作当中啊,常见的去解决这些幻觉的问题什么呢?首先第一个我们刚才前面说了, 他是因为他不知道某些知识,他才会去瞎说的,那这个时候呢,我们是不是就可以用 r a g 技术,用这种解锁增强 把它强制模型,哎,基于这个外部扩回答,我比如说问他某一某一规则,那这个这个业务规则呢?我们提前呢是在 r a g 当中已经把它 放进去,比如说我们用一些向量化的技术,把它存在我们向量数据库当中,然后他就回答的时候要求他去,他如果在原厂模型不知道,那就去向量库中去查,哎,这时候他就知道了,对吧?所以呢这是我们生产当中啊,解决幻觉最常用的一个有效的手段,就是采用这种 啊 ig 解锁增强,那一般怎么做呢?比如说我们现在呃做的就是相当于一般会先搭建一个企业的知识啊,订单的库啊, 法律的知识库啊等等这些呢,那他先通过这些模块搜索,搜索到这里,然后呢啊先通过搜索,然后我们这里说的搜索不是原来我们那个说数据库里面去简单的关键词匹配,而是通过向量去把这些数据给他匹配上, 那这个时候呢基于线索到的知识,然后再进行回答,那这个时候呢就相当于我们所说有据可依了,就是他不会自己瞎编, 那同时呢,我们还可以在提示堂词当中,在我们的限制当中去过了,如果说你问了一些专业的问题,他在他的这里面没有 相关的知识,或者他找不到不知道,可以限制他,让他不要强行的自己去歪歪,自己去脑补,那这样呢?对于我们的业务场景来说,他的准确会提升,如果说比如在一些类似于客服他不知道的情况下,可以直接转人工,把这个问题抛给人工去处理, ok, 这是第一种方法,就是我们所说的接入这 r a g 的 解锁增强强制模型,去基于外部的知识库来进行回答。 那我们再看第二种方案呢?第二种方案的话,我们相当于来说我们可以增加一个事实效应模块,什么意思呢?就是我们对大模型,我们但大家常见的是不是,比如说大家自己问豆包啊 dbc, 我 先抛一个问题给他,他先输出一个问题,那我们这个时候是不是在已有的回答这个 r a g, 比如说 前面经过 i a g 输出的结果之后,我们再进行一个事实的叫验,相当于我问你问题,大拇指先回答,然后呢我再通过我他回答的再通过,比如说我们单独的 a 进程啊,去去叫验他前面一轮回答的是否正确,就做一本检验, 然后呢?这样的话,那要求什么呢?要求你所有的回答的东西都要有据可疑,比如说你是在哪个哪个文档拿到的,哪里哪里 比到的,然后呢再和 ig 进行逐一的比对,然后进行逐一的那个,逐一的那个校验,这样呢相对来说的话,就是我们在这个,在这个章当中呢,检查两者是否一致,若出国人不一致呢?然后再再让他返回去重新的去进行一个查询,或者说 经过多次之后,我们直接可以驳视,然后啊或者一些不确定的来交给人工来做,那这是第二点,第三点呢?第三个方案呢,就是我们要,我们可以要求这个 要求我们这模型啊,强制的去回答一些东西,通过我们这个 promote, 通过我们这个呃提示词的情况下,强制他要求你所有回答问题在提示当中进行一个约束,他 不要让他自由去发挥,不要让他教他讲。就是呢,比如说我们在提示上明令加入一条,比如说你的回答谨记于哪些线索到的原文回答,每一条都必须要有原文的出处,比如说根据多少多少页,如果线索不到,然后不允许瞎编瞎讲 等等这一些东西。同时呢这只是一个大的一个方向,我们说可以通过提的,那如果说具体到业务场景,那比如说我们某一些客服、电商客服类场景,就回答的信息必须匹配商品信息库,不容易添加未提及的东西等等,进一步的降低幻觉,那这是我们的第三个方案, 那第四个方案怎么做呢?就是我们可以比如说针对这种高精准的,我们就放弃它自自动生成模式,我们采用这种结构化就相当于他一句话,我让他去填词,提前定义好回答的模板, 那那这个大模型只要他回答了所有呢,就必须基于我们前面给他的模板来进行回复。那这样呢来,比如说我们在这个模板当中,比如说他咨询一些商品的问题,售后问题,我们在这个关键中给他 用这种固定格式抽取这些关键信息,比如商品的价格,商品的库存,商品的状态,然后填到这模板当中,不让他自己生成, 就通过这种结构化的模板的形式。那这样呢,也能够去在我们一定层次上去杜绝他的幻觉,就不让他瞎说,必须所有的都要有数据依据去支撑,把他像做填空题一样填到我们这里来,那这个呢是我们也是在我们工程落地当中用的比较多的一些呃手段。 ok, 那 我们再来回顾一下,那我们针对这个,呃呃,针对这个大模型产生的幻觉,我们有这几种模式,第一种呢,我们要知道什么是幻觉,首先它不是 bug, 而是模型天生的天然的存在一个问题。 然后呢我们有四个方案去实现它。第一个呢,接入 ig 增增强,就强制它基于外部回答,就解决它不知道知识,我们把知识给它填充上。 然后第二个方案呢,是什么呢?我们增加在他通过 ig 回答的结果之后,我们再增加一个模块,叫验的模块,哎,就再去检查他回答的是不是瞎说,就做一个双重的叫验。第三个呢,我们可以优化我们这个提示词,在源头就让他你必须严格按照这个执行,不能随意瞎说,如果不会就说不会 降低他的幻觉的这个一种概率。然后呢?第四种方法呢?就是说我们可以在关键的业务上面做一些结构化的一些模板,他所有回答通过结构化让大模型去填空,如果他拿不到这个知识,那就这条知识,这个业务就相当于来说要转人工啊,就说明他回答不准确,就不让,不能够让他自由发挥。 ok, 那 这个呢?就是我们这个呃大模型幻觉产生的原因,我们在身上怎么解决? ok, 谢谢大家。

原生多模态大模型在工业图纸识别中仍频发幻觉,你要如何在工程落地层面去根治?这就是咱们今天要聊的核心硬骨头。你想啊,当你坐在面试桌前,大厂的技术总监抛出这么一个实际业务中避不开的难题, 如果你只是轻飘飘的回答,调优一下提示词,或者多喂点数据,那显然是不够专家段位的,咱们得从底层算法逻辑到前沿的 agenc workflow 架构, 给出一套能真正闭环的实战方案。为了让大家更好的学习大模型,我把完整的学习路线,还有以上各个阶段要用到的资料,可以在主页置顶群里。大家好,我是彭宇,咱们先得深挖一下,为什么即便现在大家都在用 cloud、 四点七这种原生的多模态大模型,一碰到工业图纸还是容易打脸。 说白了,这背后有三个绕不开的物理痛点。首先就是超高像素的解析瓶颈。你想啊,工业 cad 图纸的精细度是极其恐怖的,一张图纸动辄就是八 k 甚至十 k 的 分辨率,里面的字母密集的像蚂蚁一样。 虽然现在的原生大模型都有动态切图机制,但在面对那些极其微小的行为公差数字时,模型在内部处理时还是会进行下采样压缩。这种压缩就像是给模型蒙上了一层毛玻璃,一旦细节丢失, 模型为了完成预测任务,就只能靠概率去脑补那些胡掉的像素点。这就是为什么他会把八看成三,把零看成八。其次是拓普关系的张冠李戴,图纸上的线条不是孤立的,各种指引线、标注线、纵横交错, 大模型目前强在语义理解,但他还是缺乏一种绝对的欧基里德几何空间感知能力。他很难像我们人类工程师那样,肉眼顺着一根细如发丝的线,精准的跨过半张图纸,找到对应的机械零件。 一旦这种语义关联断了,即便他认准了数值,也会把这个数值安在错误的零件上。再加上大模型本质上是一个自回归的概率引擎,他生成每一个字、每一个数字都是基于概率的预测, 但这和咱们工业场景要求的绝对确定性是天然冲突的,生成模型无法像计算器一样,在吐出文字的一瞬间还能自发保证三十加四十,再加三十一必须等于一百这种数学上的字恰。 那针对这些问题,咱们在工程上该怎么治它?咱们得先从第一道防线,也就是提示词 prompt 层面去收敛它的生成空间。 你千万不能直接问他这张图纸里写了什么,那是在诱导他信口开河。咱们得用视觉思维链,也就是 v o c o t。 你 可以引导模型,第一步,先描述这个局部区域有哪些坐标特征,第二步,分析这些线条的物理走向。 第三步,再推导出这个数值的实际工业含义。这就好比让模型先在脑子里把图纸的逻辑重画一遍,理顺了 再去给答案。为了让这个逻辑更稳,咱们还可以引入视觉 rig, 就是 在 prompt 里直接塞进几张你们行业的标准图例作为 feel shot, 给模型提供一个视觉锚点,让它对比着标准规范去识别, 这能极大地纠正它对冷门符号的误判。最关键的一点,一定要做严格的 schema 格式约束,别让模型写小作文,强制它输出 jason。 当模型被框在固定的字段和类型里时,它乱说话的商值就被极大的压缩了。但是 作为一个架构师,你心里得清楚,只靠 prompt 是 守不住工业底线的。咱们得记出真正的杀手锏,解法币,也就是 agenatic workflow 智能体防御塔架构。 在原生多模态时代,我们的策略变了,我们不再是简单的外挂一个 ocr 跑流水线,而是要发挥原生 m l l m 的 大脑优势,同时赋予它调用工具的能力。 你看这个架构,我们让原声大模型作为核心大脑,先对图纸进行大局的拓布、感知和初步提取。这时候我们要设置一个致性度边界, 一旦模型发现某个区域字体太密集、太模糊,或者他自己拿不准的时候,他不准瞎猜,而是要主动出发。 to calling, 也就是调用工具。 调什么工具呢?针对高密区域,他去动态调度一个专门的高精 ocr 工具,进行局部放大识别。针对行为公差,他去调用工业符号匹配库。这就好比大脑发现看不清字了,就主动拿起了放大镜。最后,我们再通过一个特征与事实融合层, 把大模型的语义理解和外部工具抓到的绝对事实进行坐标级的对其绑定。在这个基础上,咱们还得加上最后一道物理防线,叫几何逻辑自洽引擎。 这是整个方案里最显专家水平的地方。你想啊,工业制图是有严格数学功底的,比如尺寸链必须闭环,如果模型识别出的三个分段尺寸加起来不等于它识别出来的总尺寸,那这里面一定有幻觉。这时候较远引擎直接报警拦截输出触发异常裁决机制。 在这种机制下,识别智能体和审计智能体会针对报错区域进行辩论,系统会强行对该区域进行高倍放大。再次核验,只有通过了数学逻辑自洽的数据,才是咱们最终交付给客户的百分之一百确定性输出。 讲到这里,咱们来做个专家级的面试话术总结。首先,你要向面试官明确一个认知,破局点,大模型不是万能药,你要坦诚的告诉他,即便是原生的多模态模型,本质仍是概率预测。 而我们要做的就是用工程化的手段,用语义理解力去驱动事实提取工具,用确定性的数学逻辑去对抗概率的随机性。其次,谈谈架构升级,你要强调自己不仅懂模型,更懂 agencic workflow。 你要展示如何通过突破哩赋予模型放大镜和计算器的能力,让他在遇到工业微特征时能动态消除不确定性。最后,给出一个更有深度的话术,那就是将工业规则前置化, 你可以提到那个尺寸链闭环效应引擎,这证明你深刻理解工业业务的本质。而且你还可以补上一句,这种架构不仅解决了一个底层的数据飞轮,那些被拦截下来的错误 case, 其实就是最高质量的南洋本。我们可以利用它们对模型进行 dpo 偏好,对其微调,让模型在你们的行业场景下越用越聪明。如果你能把这套从底层痛点分析到 agent 动态调度工具, 再到数学逻辑闭环的整套方案讲透,面试官一定会觉得你是一个具备实战经验,能解决复杂问题的 ai 架构专家。好了,今天的内容就分享到这里,希望这段讲解能帮你拿下心仪的 offer, 咱们下期再见!

又被 ai 骗了!现在主流 ai 大 模型在发布时呢,都会宣传幻觉率下降,那你知道吗,除了 ai 幻觉, ai 呢,还存在另一个更严重的 bug, mirage。 这个术语呢,来源于李菲菲团队近期发表了一篇论文。简单来说呢, mirage 指的是用户根本没上传图像,但模型呢,却默认图像的存在,并围绕这个不存在的图像呢,继续进行推理。 试想一下,未来智能驾驶应用场景中啊,若 ai 在 未接收到视觉画面时,自行脑补路况信息,很容易做出错误的路况判断,存在不小的安全隐患。看完论文,我立刻搭建了测试流程,这里啊,我直接放结果。 大部分时候呢, ai 会说明没有看到图片。但在场景理解测试中呢,有一轮呢,我让 ai 判断图中人群处于室外还是室内。当然了,我并没有上传任何的图片。结果呢,某主流大模型信誓旦旦的回答,从图片的视觉特征来看,这组人群显然处于室内环境。 还有一轮啊,我让 ai 分 析报纸的版面风格。另一款大模型呢,凭空捏造出版面,呈现信息密集型、布局等信息,还会制了一张示意图。 更有意思的是,经过多轮测试后, ai 竟然主动承认, ai 在 没有图像的情况下,往往会假想画面。如果你也对面 raj 现象感兴趣,可以呢,去测试一下,记得告诉我你的发现哦!关注我,我是陈凡,带你了解更多能落地的 ai 商业玩法。

怎么用 ai 工具做好数据分析?给大家分享三个亲测好用的办法可以有效帮我们避免数据结断、计算幻觉,保证我们的数据更加安全。像我们平时做自媒体开发产品,企业级都非常实用。第一个方法就是用 cloud 的 配合 excel 来做。其实现在的 cloud 大 模型已经支持接入 excel 表格了,他特别擅长处理长文本类的数据分析,我们直接把要分析的表格传给他就行了, 因为 excel 表格就可以帮我们直观地把公式展示出来。这个方法的好处就是我们就算数据出错了,也可以快速找到错误的地方,然后去纠正,非常灵活。那第二个方法就是用 kimi 去做数据分析, kimi 最突出的优势就是它对上下文的理解和总结能力比较好,像我们平时把需要整理的数据表格直接发给他就行, 自己实测下来, kimi 它的结果是要比其他大模型高的。如果你是数据分析的小白,可以直接用这个方法。第三个方法适用于对数据安全有要求的企业伙伴。用 person 结合 ai 来做。其实很多朋友担心把企业的数据上传到公有平台会泄露,那这个方法就是很好的解决这个问题。 我们只需要把自己的数据分析的需求告诉 ai, 然后让 ai 帮我们生成对应的 person 代码,我们拿到代码之后,在本地 person 编辑器里运行就可以了。好处就是我们所有的数据都留在了本地,不会上传到第三方平台, 这样既能用上 ai 的 能力,又能保证我们的数据安全。以上就是我给大家分享三个 ai 数据分析的方法,希望能够帮到大家。