粉丝659获赞818

学生的学习,跑模型训练的小伙伴,那肯定都遇到过模拟过礼盒这个问题,那我做了九年的 ai 算法,也面试过很多人,发现一个通病,十个人里面九个能背出一堆优化方法,比如加数据,正则化, job out。 但是这些方法分别解决什么问题? 你的场景该用哪些优化方案?为什么有些加了正则也没用?很多人是理解不了的,那今天我用大白话三分钟彻底讲透过礼盒的全套优化思路。那正在系统学生度学习准备算法面试的朋友,我整理了一套 ai 模拟训练全套干货, 包含了过礼盒、欠礼盒、模型调优,所有考点,粉丝留言六六六直接打包带走。那首先记住核心本质,什么是过礼盒? 简单说就是模型学太细,学太偏,他把训练级里面的噪声、杂志随机误差都当成规律,死记硬背了, 那导致呢?训练级准确率超高,但是放到测试级呢?真是业务数据上呢,效果直接拉垮,泛化能力极差,所有优化手段全部都围绕抑制模型,死记硬背,提升泛化能力这一个核心。 那我分维度给大家讲明白。第一,数据层面的优化,这是最根本最有效的方案。过礼盒最大的原因就是训练数据太少,数据单一,那数据量少,模型就很容易记住样本的细节, 那我们可以通过数据扩充数据增强清洗脏数据,让数据分布的更全面,数据足够多了,模型就学规律,不学噪声了,从根本去缓解过礼盒。 那第二,模型层面优化复杂,模型层数深,参数多,理核能力太强,特别容易过理核。那针对简单的业务场景呢?我们是可以适当的简化网络结构,减少神经元的数量,不让模型算力过剩,从结构上去降低过理核的概率。 那第三,政策化约束,这是最常用的手段。 l 一 和 l 二政策化本质就是给模型去加惩罚,限制参数权重过大,避免个别的参数过度主导模型,抑制模型的复杂程度,防止过度礼盒。那第四,训练策略优化, 训练时加入 jobout, 随机让部分的神经元失活,避免神经元过度的依赖,协同适配,那同时开启早停策略,监控验证及精度 一旦不再提升,就立刻停止迭代,防止过度训练。这里也要纠正一个误区,过你和没有通用的万能解法,数据少就优先去扩数据。模型太复杂就简化结构,训练过度呢,就用早停和 jump out, 一定是要结合场景去给出方案。如果今天分享的内容对你有帮助,记得点赞收藏加关注!

基于深度学习的遥感影像识别系统, 在视频最后有完整的安装部署教程哦,今天呢,这个系统是一个基于深度学习的呃,遥感影像智能分类系统,提供了遥感影像上传,然后分类分析结果可实时的一些功能。那么在视频最后呢,会有一个教程, 呃,第一个是怎么去替换自己的分类模型啊?第二个呢就是怎么去修改前端的界面,嗯,好的,然后最后也会有整个系统的一个环境依赖的安装和项目部署运行的一个教程。现在的话我就先把这个整个系统启动起来,看一下这个演示的效果, 我们去重新的登录一下,因为我之前登录过这个系统,所以他会有一个缓存记录,所以他进来以后就会刚才会自动的去再登录到那个账号里面。我们第一次用的话肯定是会在这个登录界面,密码默认是幺三四五六,我们登录一下。好的,然后,呃,可以看到这里还有头像啊,首先可以给他换一下头像, 然后的话我们点到这个图像分类里边,可以看到我们现在还没有任务,我们创建任务的时候,这里选择我们这个模型,它也没有模型啊,是因为我们需要去,首先需要去训练一个模型,我们才能去做这个分类,对吧? 首先训练一个模型的话,那么我们就需要新建一个训练任务,点击这个新建的训练任务,然后这里面的话我们是需要去选择一个数据集的,因为我们是根据数据集去训练嘛,现在最最开始我们需要去到这个数据局管理里边啊,去新建一个数据集,我们这个就叫做测试数据集啊,就是用于测试的数据集啊,然后我们去选择数据文件啊, 这个点到我们这个啊,项目里面有一个叫测试包,点进来以后有一个数据机啊,这个第一个是这个完整的啊,数据机啊,那么比较大,我们这里演示的话,是用这个表从里面抽一部分数据出来一个测试数据机啊,双击它,然后点击确定。好的,我们就有了一个测试的数据机啊,我们这里也可以下载啊,呃,然后也可以去编辑它的一个状态, 然后有了数据之后呢,我们去点击这个训练,去新建一个训练任务啊,那么这个任务名称就叫模型一吧,测试模型一,然后这个人数的话,我们这里做这个演示啊,我们就稍微的少一点,就按照四吧,其他的都可以调的。我们确定啊,那么现在这个 模型就正在训练了,这里可以刷新他的状态去更新啊,那么然后的话,我们可以看一下对应的后端魔算法,这里就开始去训练模型,因为我们设置的这个训练啊,替代次数是四啊,那么等会他训练完之后呢,我们这个状态就会自动变成成功啊。 嗯,他这个训练已经完成了,看到了,那么我们这里刷新一下的话,我们的训练就已经成功了,然后这里的准确率不是很高啊,因为一个是因为我们,呃,这个用的数据集是一个测试数据集,另一个我们这个迭代次数训练的还不够完全啊,大家可以试一下设置到五十或者一百去训练一下,那么 然后我们去有一个模型,之后我们去创建一,然后我们选择一张,选择一张那个我们测要测试的图片啊,我们点击创建啊, 那么当他这个识别完了之后呢?这里就会有这个类型和这个执行度啊,可以再识别一次一个。 嗯,好的,然后这里的话是会有这个用户管理的一个呃,功能,好,这就是这个系统的一个演示,你这里不需要的就可以直接给它删除掉啊。 好的,现在我们去看一下这个项目怎么去安装环境依赖和部署这个项目。然后首先是这个环境依赖的安装啊,大家可以到我这个主页上边的这一看到这个教程啊,这是保姆级的全教程环境安装项目部署运行,点开它, 然后这里边是详细的讲了这个这两个过程啊,然后里边的话是讲到了两种情况方式,第一种是用这个 scode 的 去启动所有的项目, 包括前端、后端文件服务,还有算法端服务。然后第二种方式的话,就是用这个 west code 去启动前端,然后 ida 去启动后端,然后用拍叉嘛去启动呃,我们的文件服务和算法端,那么在这里的话,我就是用这个第一种方法就是用 west code 去启动所有的子项目。首先我们去新建五个终端, 然后这个操作的话,这个操作都在这个视频里面会详细的讲到哈,然后第一个终端的话,我们是去创建我们的数据表,我们去连接一下去, 然后连接到我们的数据库表,之后呢去这个扣端的这个 d b 文件下面,点开这个出水花这个 circle 复制一下,那我们直接贴到这里。 这个过程的话就是第一个是去创建了一个我们名叫 j j 扣的一个数据库,并且在这个数据库里边去新建了我们所需要的这些表,这一步完成,然后第二步我们是去启动我们的前端, 我们前端的话是首先是进入到这个 web vue 界面啊,然后第一次运行的话,我们需要使用这个 npm instyle 去把我们的这个前端需要的环境依赖都给安装好, 等会我们就会看到这个 web vue 下面出现了一个 node models, 这个前端依赖的包啊,在它前端正在安装依赖的时候呢,我们去启动一下后端,嗯,然后后端的话我们是用这个,首先也是先进入到这个后端的目录下面,然后直接用这个 vivison boot 去运行后端就可以回车啊。 然后在后端启动的时候呢,我们首先打开我们的第四个终端,去启动一下我们的算法段啊,算法段的话是进入到这个 web plus 里边的话,第一个是首先我们需要去激活我们的这个虚拟环境啊,这个的话这些步骤怎么来的?这个库的怎么来的,这些步骤都是在这里边视频里面会讲到啊,我的这个虚拟环境现在是叫 python flow 啊,然后我这个是我自己起的名字叫 python flow。 好 的 好,激活了之后呢,我们就因为我现在也已经这个房里面有这个安装依赖了,所以就不再重复的去装了,怎么装依赖的话也是在这个里边会讲到,然后我们现在就直接去启动这个扣端的算法服务,在他正在启动过程中呢,我们去点开第五个终端去启动我们的文件服务,我们的文件服务也是用 ps 来写的,那么也是去先激活一下终端, 然后去运行这个服务。好的,看到出现网址的话,那说明就是我们这个服务已经成功了,然后看一下我们的前端。好,前端我们刚才安装依赖包已经安装好了,也已经有了这个 node 这个目录,我们就去启动一下我们的前端,用这个 npm 二 u n d e v 去启动。 好的,看到出现了网址之后呢,前端也已经启动成功了,那么我们看一下这个 java 后端啊, java 后端也已经启动成功了,他说 start 这个也已经启动成功了。然后我们看一下我们的算法段,算法段也启动成功了啊,出现这个网址,然后我们文件服务也启动成功了,所以这四个项目都启动成功之后呢,我们就可以用了。首先把这个前端的这个网址去复制到我们浏览器里面。

今天用 ai 做了一个基于本地手势识别模型的第一视角实感互动游戏,这个模型由随机采集的手势样本训练得到,游戏运行时通过摄像头实时识别手势,并将识别地图转换成游戏中的控制指令。 整个过程大致分为几个步骤,首先是确定程序逻辑,摄像头实时捕捉手部画面, media pop 负责检测手部关键点和手部位置, 程序根据检测结果裁剪手部区域,再将裁剪出的手势图像输入到 mobile netf 二、迁移学习模型中,判断当前手势类别。简单来说就是先找到手,再识别手势,最后把手势结果变成游戏操作。第二步是采集样本数据。为了训练手势识别,模型 一共设置了七类手势,包括张开手掌、握拳、手枪、 ok 点赞、手指指向和 v 字手势。每一类大约采集一千张左右图片,总共采集了七千多张手势样本,用来让模型学习不同角度、距离和姿态下的手势特征。 第三步是进行模型训练。采集完样本后,使用 mobile netf 二域训练模型进行迁移学习,让模型在已有视觉识别能力的基础上 学习这些自定义手势类别。训练完成后,模型验证准确率大约在百分之八十七左右,整体效果已经能够支撑基础的实时交互。 第四步是进行模型测试,通过摄像头实时测试发现不同手势的识别稳定性并不完全一样,其中张开手掌、握拳和手枪这几个手势识别比较稳定,适合作为游戏里的核心控制指令。 手指指向、 v 字手势和 ok 手势相对,容易出现误识别,因此没有作为主要操作手势。为了减少误触发,程序还加入了 stable 多帧稳定识别机制,只有连续多帧识别结果稳定后才会触发对应动作。最后基于训练好的本地手势识别模型。

我发现绝大多数学大模型的人最后都学废了,不是大家不努力,而是根本就没有一套系统的学习框架。那每天碎片化的刷视频,今天学 rag, 明天学 agent, 知识点零散混乱,学了几个月呢,既看不懂底层原理,也做不出落地项目。那很多人学大模型最大的误区呢,就是一上来就啃复杂的论文,去堆高阶的一些项目,基础都还没打牢,就越学越迷茫,越学就越觉得没有信心呢。那真正专业的大模型学习呢,一定是分层递进的, 从会用、会训、会优化,再到会部署、会做前沿应用,那每一步呢,都有明确的目标。那我带过很多入行的新人,今天花五分钟把从零基础入门到大模型高阶进阶的完整学习思路一次性给大家梳理清楚, 全程循序渐进,可落地可执行。那看完呢?彻底告别盲目自学。第一阶段是零基础入门,核心的目标呢,就是两个字,会用, 不用一上来就纠结复杂的原理。先熟练掌握主流大模型的 api 调用,那不管是 gptixic 还是 cloud, 能够熟练的调用接口,实现基础对话、简单的功能的开发, 那先建立对大模型的直观认知,去跨过那个入行的门槛。第二阶段就是进阶,学习核心就要从会用变成会改。这个阶段呢,就要吃透深度学习的基础,去搞懂神经网络,听读传播原理, 还有要理清 n l p 的 眼镜逻辑,从 r n n l s t m 到 transform 的 迭代过程,重点去吃透 transform 的 核心机制, 自注意力位置、编码、残差连接,这些都是大模型的底层根基,那同时要学会像 lora 清亮微调啊,能够去针对自己的业务场景去做简单的指令微调。第三阶段是模型认知升级, 去学会看透模型的本质,要分清 word、 g、 p、 t、 nama 这些主流模型的结构差异和设计思路,去搞懂为什么现在工业界清一色只用 record only 架构,那看似简单的模型选择,背后全是工程效率和商业成本的权衡, 那你懂的这些才算是跳出了纯调用工具的层面。同时呢,掌握分词机构、 k、 v、 cash 这些核心的优化知识点,那理解模型高效运行的底层逻辑。第四阶段是真正拉开差距的关键。模型训练与对齐, 你要掌握数据处理的全流程,数据采集清洗,去从结构化构建,那要记住高质量数据才是模型效果的核心。其次要吃透完整的微调体系,学习率优化器,选择、混合精度训练、梯度累计,那独立跑完完整的 s、 f、 t 指令微调, 还要掌握前沿的对齐技术,不仅是要懂传统的 raf, 更要掌握趋势更强、更简洁的 dpo, 直接偏好优化。那第五阶段去主攻工程化部署,学会模型量化、蒸馏减脂等压缩技术,那掌握分布式的训练, k v 缓存优化、动态批处理、容器化部署, 让模型能高效低成本落地线上的服务,去具备企业级落地的能力。第六阶段,深耕前沿的应用实战,独立搭建 rag 知识库系统、智能 agent 多任务协调系统,拓展 clipp 多模态能力,那同时学会模型的评估、幻觉优化、版本迭代,去形成完整的项目并环。 那我把这套六阶大模型学习路线呢?整理成了完整的高清图谱,各阶段学习资料,想要完整版的同学评论区扣大模型,我无偿发给你。 ok, 那 我是果果姐,如果内容对你有帮助,记得点赞收藏,我们下期再见。

用 open 视觉做物体识别,这个不需要任何训练,只需要在排放里 p github 仓库 get 你 所需要的用途版本就可以做基础的识别,然后连接你的摄像头,对准屏幕就可以做这个识 别功能。但是不是水平对准,需要做基变调整,可以用 wall perspective 或者屏幕四角添加定位点。

大家好,今天聊一下这个深度学习, pipeline 就是 就是框架的意思,就是呢,我们每次这个之前呢是,呃 写代码的时候呢,都是把这个什么,呃输入配置模型参数啊,加载数据集啊,定义模型啊,呃定义评价指标做评测,然后训练流程都放在一个文件夹里,这样的话就是不太好, 呃,不太好修改,我们把它放到不同的文件里呢,这样的话就比较好修改,比如这个输入模兄配置参数呢等,这个点 p y 比,比如他把这个学习率啊, hideon size 啊,文件读取路径啊,这个都放在一块,所以呢它就是方便易读,还可以备份不同的版本。呃,复现之前的这个,这个训练, 比如 load 点 p y, load 点 p y 呢?它就是加载不同的数据集啊,这个不同任务的这个这个数据来历是不一样的。 然后呢这个 model 点 p y 呢,就是定义这个,呃模型结构,这个 value 的 value, 点 p y 呢,就是定义评价指标做评测。 n 点 p y 呢,就是训练主流程。 然后呢上面就是这个,这个视力,那适合自己的,用习惯了就好。呃自己的项目呢,有额外的功能,还可以再加微调的话,就是,呃只改数据就行了。然后大模型的优点呢,就是统一了这个训练范, 这就是一个配置文件, 这是模型的路径,这个是训练路径,这个是测试路径啊,这个是这个词表,然后模型的模型类型,呃这个文本最大长度 item size, 这个 kernel size, 然后这个是层数 match size, 这个什么学习率这些这是训练轮数啊,每次训练时候把这个配置复制一遍,下次呢就是备份一下,然后下次再用这个配置呢,还能复现出之前的效。 然后这个呢是数据加载的,然后呢比如说任务呢,有十几类,然后就准备一下这个 index 到它这类别的这个这个映设表 相当于呢是对这个任务专用的这个这个代码, 然后呢这是对数据的进行读取,然后做编码,然后再做这个这个 padding。 它的好处就是未来做训练的时候,可能不同的这个任务,它模型啊配置都一样,不同的地方就是数据数据不一样,所以这样的话就非常灵活。 比如我们重新做一个分类中,可能我们的分类跟这个不一样,我们就改一下分类就可以了,所以就是可能就改一下这个 logo 以外就行了。这个这个模型结构啊,这些什么这个评测呀,主流程都可以,不, 然后把模型独立出来也是合理的。然后这就是我们的一个模型,它会从这个配置文件去读取这个 config, 就是 读这里的 config。 然后呢又准备了很多的不同的模型在这,很多很多不同的模型在这都都把它准备好, 这些模型呢可能可能他们的 boss 都是一样。 还有这个评价任务,就是不同的同类任务,其实评价的标准都都差不多,不同的不同类的任务可能标准不一样,比如我们的分类任务,比如分类任务,基本都是用这个准确率来评价的, 换了一个任务,比如分词任务,那那肯定这个评价这块就是需要改。那做新的任务的时候呢,就可以先把这几个文件都先复制过来,然后再思考一下需要改哪些,改,改哪些东西。 然后我们这主流成文件呢,其实就是我们的关键词里写的那些东西,然后把所有东西呢都都给他拿,都给他拿进来。 比如这个这个 model, model 这个文件里拿到这个 model, 这个 value 的 模块里拿到这个 value a t, 然后就就是加载参数,嗯,然后呢加载数据,然后呢这个这个这个抽象这个模型,然后看看是不是用 gpu 加载优化器加载这个测试类。然后就是训练了,就是写扩循环,然后训练训练多少轮 不归零,然后反向传播这个主流程,这个函数基本上是改成最小的,因为对于神经网络它的主流程都是一样的。 验证模型的话就是在这进行验证,对于大魔性微调来说就是改的东西更少,可能这些都不用改,只改训练数据就行。

我和青北交叉院的硕博聊天,或者和韩店老师讨论,都觉得大家现在对 ai、 模型、神经网络这些东西想的太复杂了。无论你是做科研也好,做项目也好,你做理论 ai 或者是交叉学科,我们要返璞归真。就是,其实我们在初中就学过怎么调模型,怎么用好一个模型, 这个方法就是控制变量。上一个视频我们说了怎么选择一个合适的模型,那么这个模型选出来肯定不是我们直接就能用的啊,直接就万事大吉了。 如果说你听到这里比较懵,你可以看一下上期的视频,我们用这个方法挑选出来的模型是咱们现在任务中最小可执行化的模型工作,我们叫他 mvp, 他 可以保证咱们的任务在过你河的概率比较小的前提下,拿到一个正常的结果。不是最优的结果,是正常的结果 之后是不是得调整啊?那就会有两种情况啊。第一种情况就是欠你和通俗一点来说就是模型容量不够啊,模型太小了,支撑不了我们这么大的数据。那你现在把你的全部代码复制给 ai, 让他看看里面有没有照炮的层,如果有的话把它删了。 至于原理,呃,你感兴趣的话可以推一下,我这里直接讲实操。好吧。第二步就是神经网络变长,多加一点层数, 比如说加一个下阶层配合水路计划函数啊, leak 水路也可以。另外如果说你现在的 mvp 已经很深了,那么计划函数应该换成 几路函数加长的时候不要一上来就凑成两倍三倍一点点来,在中间插入限行层的时候也要注意输入和输出的维度一定要相同,不然你就是在加长的同时把宽度也给改变了,是这个道理吧。 加一层发现准确率变高了,你就再加一层,直到这个准确率幅度在正负一以内吧。呃,这个不同项目有一点不太一样,反正你把握一下这个准确率是多少不变。 第二步就是神经网络变宽,要不要把它,不要一下子就把它变成幺零二四。假如说你原来的呃神经网络是六十四个神经元,那么 就一点五倍或者二倍,一点点往下往上加,这样这里注意了,变宽的时候你可能发现一个现象,就是你加宽了,它的准确率不变或者下降一点, 那么这时候你也别放弃,就是我们学习率降低,比如说你之前的学习率是零点零一,现在你的学习率变成零点零零五,因为宽度和学习率经常藕合。那你说我怎么确定这个准确率是学习率的功劳还是加宽的功劳? 你可以把宽度去掉,然后单独减学习率看一下,是吧?就最简单的控制变量就很好用。最后一步就是加模块,如果说你的任务是图像,那就加一点卷积,如果说你的是虚列,那就加一点 transform 的 模块,是吧?好的, 现在 mvp 拿到以后,你发现他没有铅笔盒,那 lo 变成了 n a n, 这时候你听我说什么原因啊?就是你的数据处理错了,里面有无熊大或者零 算 loss 的 时候,你把这个零除以到分母上了,或者说把零放到对数均算上来,这时候你改一下数据,并且加一行 t 度裁剪的代码,就让 ai 直接给你就好了。

isop 检测系统是如何训练的?既可以将训练素材放入云端进行训练,训练完成后将模型下载到本地进行运行,这样部署成本较低。 另外也可以在本地部署训练服务器,训练完成后直接运行,训练部署都在本地,确保数据更加安全。

我们接着介绍一下海康威视的感知类产品。第二类就是智能交通产品。海康威视智能交通产品主要分三大类,第一类是智能交通的抓拍系统,二零幺五年同时进一步迭代升级了观澜大模型为基础的交通行业的专用大模型,显著提升了包括像没有系安全带、 驾驶时使用手机啊、车斗载人等多项违法行为以及车辆特征识别的准确率,并进一步拓展了对大货车的管控和非机动车不安全驾驶行为的检测应用。公司发布了一千两百万分辨率的系列交通相机产品,在产品纵向视野上 叫上一代提升是显著的,结合了新一代的 ai s p 的 图像算法,能够在满足新补光灯标准的前提下,实现更优的图像效果和更强大的大灯抑制效果。同时环保型一千两百万系列的产品在减轻光污染方面取得了效果。 这些技术的提升有效推动了智慧交管业务从单一的齐正向前要素精准感知眼镜,使公司产品成为国内智慧交管领域的核心基础设施。海开威士在智能交通产品的第二类产品主要是交通基础设施数字化,企业主要是以公路跟高速公路为主要场景,包含了收费车照车牌的识别、 门架卡口、车型识别相机、一体化的栏杆机、 etc 天线以及交通事件检测服务器等关键产品,主要专注于提升收费的效率,保障通行的安全。而且公司在持续优化产品硬件的结构设计,显著增强在恶劣天气等复杂产品下的适应性。在上法层面呢,依靠世界大模型以及多模态大模型技术, 有效提升了车型识别的准确率以及道路交通异常事件的检测能力。通过技术创新和产品迭代优化,公司为交通基础设施的数字转型提供了更加智能可靠的产品和解决方案,有力的支撑了行业向高效安全的方向进。智能交通产品的第三类产品是 智能信号的控制系统业务,公司持续强化了前链路的资源优势,前面构建了韩泰向雷士融合的感知信号灯、信控算法的盒子、信控平台,以及配时优化服务 在内的五位一体的全体系的资源架构。在硬件方面,公司发布了全新一代的九十二到九十四 g 赫兹频段毫米波镭射一体机油,并创新发布了七系列的高端智能信号机油,进一步落实了系统控制底座的基础基础。在算法应用的层面,公司也推动信控方案向机动车、非机动车、行人前要素管控, 而生化眼镜哦,显著提升了对各类交通参与者的精细化的调度能力。在系统交付以及服务层面,依靠自由的星空配饰团队,公司打通了从前端的精准感知到后端的配饰优化的业务的弊端,能够全面支持城市复杂交通场景的高效治理需求。以上就是海康威视在智能交通领域的产品情况。

你是不是有这种感觉,想用 python 做深度学习,但是代码水平呢?又拉跨的不行?别慌啊,这不是你的问题,这是绝大多数跨学科的人都会踩过的坑。但是一句话,深度学习不是靠天赋,是靠路径。路径对了,你一周就可以入门,那路径错了的话,你可能搞一年你都是在白忙。那今天我给你一条最硬核、最现实、 最不废话的学习路线,四个阶段你照着做。第一个,先不要写代码,先搞明白深度学习到底在干嘛。 很多新手一上来就想那些模型啊,结果写不通,调,不懂,搞不懂为什么?因为你连深度学习最底层的流程都没有吃透。 第一个阶段,你就只干一件事情,就是搞懂为什么和是什么。这里呢,我推荐深度学习入门的基于 python 的 理论与实践这本书。那信我一句啊,你只要看完前两章,你就能把神经网络、前向传播、反向传播、损失函数这些概念搞得清清楚楚。 这个阶段呢,核心呢,并不是代码,那么它是构建体系化的知识,你脑子清晰了,你后面学 python 才不会懵。那第二个阶段呢?上手 python, 跟着做啊,有了第一个阶段的基础,你就可以正式的进入到 python 这里呢。我推荐小土豆的 python 教程,简单清晰,不拖它。这个阶段,你的目标只有三个,搞懂张量是什么,怎么操作,会写一个最小可运行的神经网络模型, 能跑通训练、循环、前向损失、反向更新参数。那么别追求炫技,先把流程跑顺了。深度学习啊,所有花里胡哨的东西,最终都会落到这个流程上面。 那第三个阶段,提升模型的理解,开始看懂别人写的代码,那你做完前两个阶段,你就只能说你算跑通,但是真的到了项目里面,你就会发现,模型多到你怀疑人生。所以啊,第三个阶段,你就要去升级视野规划,理解各种经典网络到底是怎么来的。 在这里呢,我推荐了唐雨霏的 python 深度学习实践,它能够让你真正地知道 cnn i n n transformer 是 为什么被设计出来,解决了什么问题。那做到这一步,你就会突然发现,哎,以前你看不懂的开源项目,现在你能够读懂 百分之七十的。那第四个阶段,你就开始动手做项目了,用自己的领域问题来练手。前三个阶段搞定以后啊,你其实已经具备了落地的能力。这个时候呢,你要做的不是说继续去啃教材,而是找一到两个和你专业相关的小项目,直接上手就行了。 为什么?因为深度学习啊,学到最后都是一句话,你能不能解决真实的问题,跑通一个小项目,比你看一百本书更值钱。最后呢,说一句重点,不要再自己瞎摸索了,学习,深度学习啊,最怕的不是呢,是没有路线图, 那瞎学半年,一点成果都没有。最后呢,我也是整理了一个二零二六年最新的深度学习入门思维导图,包含了四个阶段,学什么,怎么学,用什么书,看什么教程,需要的直接安排。

这一期我们先不急着背概念,而是用两条线把它讲顺。第一条线是教机器分清猫和狗,看看机器到底怎样从例子里学习。第二条线是把大模型想成一个学生,先大量读书,再做专项训练。这样机器学习、深度学习和大模型 就不是三个孤立名词,而是一条逐步变强的路线。上一期我们沿着时间线看 ai 怎么从早期规则系统走到 check gpt。 这一期换一个角度,不再追历史,而是拆机制。我们会从一个很具体的猫狗识别任务开始, 看机器怎么学,再看深度学习为什么更强。最后再讲大模型为什么能做更多事情。很多人一听机器学习、深度学习、大模型, 就觉得它们都和 ai 有 关,好像是在说同一件事。其实它们容易混,不是因为词本身多神秘,而是因为常常被错误的并排放在一起。先记住一句话,它们有关联,但不在同一层级。下面我们先把位置摆正。机器学习是一类方法, 核心是让机器从数据、理学规律。深度学习仍然属于机器学习,只是它用多层神经网络能处理更复杂的信息。大模型则是深度学习继续放大后的形态, 数据更多,参数更多,任务范围也更大。先有这张地图,后面每个概念才不会散。 ai 可以 先理解成一个大目标,让机器具备识别、理解、判断和生成的能力。猫狗识别是识别,回答问题是理解和生成, 做选择是判断。机器学习、深度学习、大模型都是为了接近这个目标的不同路径。接下来,我们从最容易想象的猫狗识别开始想象。我们要教机器看图,判断这是猫还是狗。如果靠人手写规则会很快卡住,因为猫和狗都有耳朵、眼睛、毛发, 现实里的图片还会有角度和光线变化。机器学习的办法不是把规则写死,而是给他很多例子,让他自己从例子里慢慢找规律。训练机器第一步是准备例子。 很多猫狗图片放在一起就叫数据集,也就是训练粒子的集合。每张图片后面标着猫或狗,这叫标签。标签就像每道题后面的标准答案,机器先看题,再对答案,后面才知道自己到底有没有猜对。模型可以先当成一个判断器,你给他一张图片,他输出一个猜测。 比如猫或者狗,刚开始他可能很不靠谱,把猫猜成狗也很正常。训练的重点不是让他第一次就答对,而是让他每次猜完以后,都能利用错误继续改进模型。猜完以后,我们不能只说一句错了, 还要告诉他错的有多严重。这个给错误程度打分的工具就叫损失函数,分数越高,说明离正确答案越远,分数越低,说明越来越接近答案。这里不用展开公式,把损失函数先理解成错误分数就可以。模型之所以能变好, 是因为它内部有很多可以调整的数值,这些数值叫参数。你可以把参数想象成一排排小旋钮, 有的旋钮会让模型更偏向判断成猫,有的会影响它判断成狗。训练时,模型根据错误轻轻调这些旋钮, 让下一次预测更接近标准答案。知道错了以后,模型不能乱改参数,它需要一个方向告诉自己怎样调整,错误才会更小。梯度下降可以先用山坡来理解损失,就像高度模型每次沿着更低的方向走一步,每一步都不一定完美,但只要方向大体对, 错误就会一点点降下来,把前面几步连起来,就是训练循环。模型先预测,再用损失函数看错了多少, 然后通过梯度下降找到调整方向,微调参数,再重新预测。这个过程要重复很多次。模型不是突然开窍,而是在一次次预测犯错调整里,慢慢变得更会判断。如果模型只记住训练图片,那它只是会背题。训练集里的猫狗,它能任换个角度、换个背景, 或者出现一张没见过的新图,它可能就不行了。真正有用的模型要能处理新样本,这种能力叫泛化大白话就是不是被答案, 而是真的学到了规律。普通机器学习经常需要人先帮它设计特征。比如识别猫狗时,人可能会告诉机器 看耳朵、看脸型、看毛发、看轮廓。问题是现实图片太复杂,人很难提前写清楚所有有效特征,于是一个更强的路线出现了。能不能让模型自己学会该看什么?深度学习仍然是机器学习,但它更强的地方在于可以自己学习特征, 这个能力较表示学习听起来专业,其实就是模型自己慢慢发现哪些线条、形状和组合对判断猫狗有用,人不再需要把每条规则都写死。 模型可以从原始图片里学出更有用的表示。深度学习里的深主要指层数多识别猫狗时,前面的层可能先看到颜色、边缘和纹理,中间的层把这些组合成耳朵、眼睛、轮廓等局部特征,更后面的层再综合起来,判断整体更像猫还是狗。它不是一下子看懂, 而是一层层把信息整理得更有用。刚才说的是正向过程,图片进来,信息一层层往后传,最后给出判断。可如果最后判断错了,模型还要知道到底该改哪里。 反向传播做的事就是把最后的错误沿着网络往回传,让每一层每个连接都知道自己大概该调整多少。简单说,正向负责判断,反向负责改模型。神经网络这个名字容易让人误会,好像它就是一个人造大脑。 但其实不是,它只是借用了人脑里神经元相互连接的灵感,本质上仍然是一套数学计算结构。你可以把它想象成很多小节点连在一起,每个节点接收一些数字,经过计算后再把结果传给下一层。这些连接的强弱,就是模型需要训练出来的东西。 所以神经网络可以很强,可以识别图片、处理文字、生成回答。但这并不代表它有意识,它看起来像在理解世界 底层,其实仍然是在做大量计算机器。不像人一样,看到一张图就知道这是一只猫,也不像人一样,听到一句话就直接理解它的意思。对模型来说,图片、文字、声音 最后都要先变成数字。比如一张图片可以看成由很多像素点组成,每个像素点都有对应的数字, 一句话也会被转换成一组组向量,让模型可以计算。所以模型内部真正处理的不是我们眼里的图片和文字, 而是一大堆数字之间的关系。这里提到的矩阵运算,可以先简单理解成很多数字,按照一定规则一起计算,不用记公式,只要记住一点, ai 看起来像在理解世界,但它的底层其实是在处理数字。激活函数这个概念不用讲得太复杂,你可以先把它理解成 给神经网络增加转弯能力的一步。如果没有激活函数,网络即使叠了很多层,也可能只能学到比较简单的关系。但现实问题往往不是一条直线就能分开的。 比如判断一张图片像猫还是像狗,可能要同时看耳朵、眼睛、毛发、轮廓,还有它们之间的组合关系。激活函数的作用就是让网络不只会处理简单关系,也能表达更复杂的规律, 所以它不是最需要展开的重点。你只要记住它,让多层网络真的有能力学复杂东西。大模型不是和机器学习、 深度学习并列的另一个东西,它更像是深度学习继续放大后的结果。只不过学习对象从猫狗图片扩展成了海量文本、代码、图片和对话数据更多,参数更多,训练需要的算力也更大, 于是模型有机会学到更广泛的规律。大模型的大当然包括参数多、数据多、算力大。但更关键的是,它学到的基础能力可以迁移到很多任务里。 就像一个人读过很多书,不只是会做一道题,还能把积累的知识用到写作、总结、问答、翻译和代码里。通用性来自这种能力迁移预训练,可以用学生读书来理解, 学生先大量读书,不是马上为了某一道题,而是先积累语言知识和常识。大模型也是这样,先看海量资料,学习词语之间、句子之间、知识之间的通用规律。这个阶段是在打底子, 有了底子后面才好做具体任务微调。就像专项训练,一个学生读了很多书以后,如果要参加作文比赛、编程考试或者做客服面试,还需要针对任务再练一练。模型也一样,预训练,给他基础能力 微调,再用更具体的数据教他按要求回答,按格式输出,按任务完成。大模型能写作、总结、问答、翻译、写代码,不是因为每个任务都从零学了一遍,而是因为这些任务都能用到同一套。基础能力 理解,语言识别模式生成,内容能力可以迁移,所以它看起来更通用。但模型大不等于永远正确, 数据和使用方式仍然很重要。最后,把三者关系收束成一句话,机器学习是用数据训练一个判断器。 深度学习是让模型通过多层网络自己学习特征。大模型是把这种学习能力放大到海量数据和更多任务上。理解这条线我们后面再讲,监督学习,强化学习,过你核就会顺很多。

上一集我们拆解了神经网络的基本原理,今天聊一个关键问题,为什么网络深了就变强了?深度学习到底深在哪? 深度学习就是有很多隐藏层的。神经网络深指的就是层数多,从几层到几十层,再到上百层,层数越多,能学到的特征越抽象。 浅层网络只能学简单特征、边缘、颜色、纹理。深层网络能组合简单特征,学出复杂概念,从纹理到形状,从形状到物体,从物体到场景。 以识别人脸为例,第一层学边缘和线条,中间层学眼睛、鼻子这些。局部,深层学整张脸的结构,每一层都在上一层的基础上抽象,从具体到抽象,从局部到整体。 深层网络不是新想法,一九八零年代就有了,但以前跑不动。层数一多,梯度在反向传播中不断缩小,前面的层几乎学不到东西。这叫梯度消失问题。 两个关键突破救了深度学习, rio 又激活函数,让梯度不容易消失。残差连接,直接把前面层的信息跳传到后面,相当于给梯度修了条高速路。这两个改进,让网络从几层直接堆到上百层。 深度学习最早的大杀器是 cnn 卷积神经网络,它专门处理图像,用卷积盒在图片上滑动提取特征,像放大镜一样逐区域扫描,参数少,效率高,图像识别从此起飞。 处理序列、数据、文本、语音、时间。序列用的是 r n、 n, 它有记忆,能记住前面的输入来理解上下文,但 r n、 n 的 记忆会随时间衰减,太长的序列处理不好。 二零一七年, transformer 出现了,他用注意力机制替代了 r n n 的 顺序处理,不用一步步来,可以同时关注所有位置。这个架构直接催生了 g p t burt, 改变了整个 nlp 领域。 深度学习很强,但代价也大。训练 gpt 三用了上万块 gpu, 电费就几百万美元。模型越大,需要的算力和数据指数级增长,这不是普通玩家玩得起的。 深度学习也有短板,需要海量数据,训练成本高,结果不可解释,容易被对抗样本的利器。 深度学习靠什么跑起来的数据?下一集我们来聊 ai 的 燃料数据。

大家选进就是我们 ipc 这块的东西,这个设备可以拿拿起来看,他是两个镜头,这两个镜头都是可以去旋转的。 这个在杭州地铁里已经在用了。对,杭州地铁我见这个实物了,安装场景。对,所以说这个设备首先从它抛开大模型的功能不讲的话,它的环境适应能力会很强。嗯, 你比如说第一个就是我要做做人脸,对,但是我这个宽,这个大门的宽度可能比较宽。嗯,没错,以前我用一个摄像机去做的时候,可能可能覆盖三到五米,对,但我大门十米我都得用俩, 对,对吧?现在我用一个相机把两个镜头调的这块去做人脸识别,你这个很灵活的,可以做一面做宽,也可以做这样旋转做九十度,对,也可以一百八十度,然后比如说这是一个梯子路口,嗯,你可以这样一个看这边,一个看这边。对,这都九十度了吗?对,或者说是一个直的的路上。哎,背,对背啊。对 啊,反正整个,当然他他里面的那个算力是分开的,你可以给他设置那个中介,可以给他去设置这个人脸照方案啊,后边的算法,对,后边结构化检测。反正这个这个设备我们有,这是一个双木的,我们还有一款四木的。哦,就下面视频的这四木。对,下面四木 里面搭搭载的是一个十六 t 的 一个算力的,是一个 gpu 的 一个芯片,所以说这块的设备的算力是很强的。在室外的部署是吧?需要对功能需要智能化的部署啊。对,然后我们现在在这个基础上,我们又加了刚才讲的那些大模型的一种功能,就让他这块,所以说他一般我们把它定义成专门 做这种人员。人人人,那个人脸结构化,结构分析的,结构化分析的一个设备代表给城管啊、给市政啊,是吧?很多,对,很很多。对对,这部门大型园区这个大型场景啊、机场啊、火车站这种人员多的分析的场景,这个产品很好。对,是的。 然后这块是我们的环视,嗯,大家跟跟他很像,对,就是在他的下面其实我们加了一个球筋,球筋,对,跟三百度去换了一个球筋,这个远距离跟踪他细节更更好了。是,就是,就是他们去可以,比如说他们去可以,可以去去剪出一个细节。嗯啊,做一个 目标检出,检出完之后我严重求其可以去抓拍更多的细节回来啊。大场景的一个监控,那他一般比如说是我们运在,呃,有几种用法,一个是运在高速上,嗯,高速上的话他可以去做那个道路事件的检测,嗯,他比如说检测到这块有一个 那个事故了,对对,有一个问题了,对,说这抛杂物什么的。嗯,他去检测,他检测到目标之后会连着他去看细节,去看这个东西是不是去判断啊?就去判断。对对,他可能运用一些道路的事故检测,反正一般会运作一点。然后这款摄像机的话,这两个镜头是可以拼接的。 哦,这俩能拼成一个画面。对,我们有一款就不是所有的都是啊。可以可以,场景需要专门的拼接款,你可以选择不拼接。对对对。单独一个一个去看那,一个去看那 啊,他这样看的话其实解决的一个球机画面不固定的问题。对对对,比如我关这边一个关键画面,这边画面对,自己去看,哎,再再联动球机去做动作,球机去看细节。嗯啊,那还有一种场景的话,就是 把它俩放到这边,嗯,然后把它拼接成一个一百八十度方向,对,当成一个,当成猫头鹰去一个,它的功能会更根据多场景的一点。对,它更更灵活一点。对,你看让它镜头也可以放大 放,这就是蓝标,就是咱灌篮大模型产品是吧?对对对,这个 l m l m。 对 对对,产品标识没错,基本上每一个大模型。