粉丝1777获赞6195

上期我们讲完了图像标注的四大工种,很多新手私信问我,刚开始入行,到底先练哪个项目最合适?今天直接给大家精讲全网需求量最大、上手最快、接单最多的基础项目。二 d 举行框选标注。 可以这么说,百分之九十的标注,新手第一单接触的都是二 d 框选,它门槛最低,应用最广,项目最稳定,也是所有视觉标注项目的基础工。 首先一句话讲懂什么是二 d 框选标注,就是在图片和视频画面里,用标准的矩形方框,精准把需要识别的目标物体框出来,让 ai 自动识别,自动捕捉、自动预警。 我们生活中所有的智能监控,道路违章抓拍、自动驾驶障碍无识别,全部靠海量二 d 匡选数据训练出来的。我给大家举几个最直观的例子,自动驾驶场景里,我们要匡出路上的汽车、电动车、行人、红绿灯、路标护栏、智能安防场景里,我们要匡出画面里的陌生人、 徘徊、人员掉落、杂物、违规堆积物,甚至商超人流统计、工地安全识别,全部都是二 d 框选的应用范围。很多新手以为画框很简单, 随便框住就行,这是最大的误区。真正合规的二 d 框选,有一套严格的行业标准,也是大家最容易扣分返工的地方。 今天把新手高频错误一次性讲透。第一,框体必须紧贴物体边缘,不能框太大,留白过多, ai 会识别不准,也不能框太小,切掉物体边角,属于严重标错。标准就是严丝合缝包住目标物体边缘,不留白布裁切。第二,遮挡物体必须完整框出 很多画面里的车辆、行人会被树木、栏杆遮挡,新手容易漏标或者纸框。可见部分行业标准是,只要能判断是完整目标,哪怕局部遮挡,也要按照完整轮廓完整框出。第三,不重复,不漏标,不多标。一个目标只能对应一个方框, 重叠画框、空框、多余框,漏掉目标都是直接判不合格,也是新手反光率最高的点。第四,模糊远景小目标不能直接放弃, 只要项目规则里要求标注,哪怕画面模糊,距离很远,物体很小,也要精准框出,随意跳过小目标会直接整批扣分。讲到这里,大家应该明白为什么二、 d 框选是新手必练的基本功,它看起来是最简单的标注方式, 但最考验细心和规范度。框选标准练扎实了,后续的分割关键点等高新项目,你上手速度会快一倍。最后总结一下,二、低矩形框选是视觉 ai 的 基础,也是标注行业永远刚需,不愁没单的核心项目。 新手不用好高骛远,先把画框练标准,练规范,你的合格率和效率提上来,收入自然稳定。下一期我们精讲比画框更容易翻车的图像分类标注,看着最简单,实则坑最多,想少走弯路,记得持续关注更新。

语义,分割如果你只想发篇二区三区或者 b 会 c 会,那真的太简单了。很多搞 cv 的 同学天天盯着 cityscapes 或者 voc 这种被大肠卷烂的公开数据集,你拿实验室那几张卡拼了老命去跑自动驾驶的街景分割,调了两个月 i o u 死活提不上那零点五个百分点,绝望得想退学。 听鱼哥的,想拿偏 b 会 c 会保底的,千万别碰自动驾驶,直接掉头去做医学影像或者工业微小分割。街景分割大厂早就做透了,但在医疗领域,比如某个罕见肿瘤切片或者工业领域,比如某种特定材质的裂纹,极其缺乏高精度的分割模型, 你随便找一个最新的轻量级分割网络,在他的解码器里加一个边缘感知模块或者跨切片。注意力机制论文里写针对该特定组织边缘模糊及难分割的痛点,论文提出了强化边界特征的新架构, 你避开了算力红海,解决了极其垂直的痛点。二区三区七堪最喜欢这种脚踏实地的医学工业交叉应用。如果你自己找不到这种冷门又好出图的医疗或工业分割数据集,于哥手里目前刚好压了几个特定病灶。 工业分割加新型注意力机制的现成课题核心的对比实验,我已经小规模跑通边缘分割,效果极其丝滑,急需一 v 一 直接定题开干,不想再痛苦调餐的同学可以来找我,带你降维拿分。

语域分割,你是不是还在像素级标注?一张图要花半小时,标了几百张,眼睛都快瞎了。其实三四区 cs i 根本不需要你搞几十万张精细标注,审稿人心里清楚,你没有标注团队,也没经费重包,他们只要求你用偷懒的方法把分割任务做完整,就能过。下面三个方向,标注量少、代码限程不准、精度 照着做就能发。方向一,弱监督分割,用框标注代替像素标注,你不需要画每个像素的边界,只需要在目标周围画一个矩形框,然后用弱监督方法从框标注中生成伪像素标签。在公开数据级用框标注训练对比全像素标注模型,你的精度只低五到百分之十,但标注时间节省了百分之九十。方向二,半监督分割, 用少量标签加大量无标签数据,你只标注了一百张图,但手头有一千张无标签图,用这一百张训练一个教师模型,给无标签图生成伪标签,再挑高致性度的一起训练,迭代两轮,你的模型就能接近全监督五百张标注的性能。方向三,类别不平衡分割 只关注少数类,医学分割中并造区域往往只占图像的极小比例,比如百分之零点一,你不需要改进整个分割模型,只需要在损失函数里加一个类别权重或 foco loss, 让模型更关注那些稀少的类别。 对比标准交叉商,你的模型在罕见类别的上的代词技术能提升十到十五个百分点。如果你还不知道怎么做弱监督分割,怎么搭半监督叠带,怎么结合自己课题落地,别再瞎琢磨了,我把这些方向的选择题思路、论文结构、内外缝合技巧全都放进了顶会论文缝合新法里,直接套用出符合你方向的顶会论文。大屏大分割,七哥陪你少走弯路,直接弯道超车。

做二 d、 三 d 融合标注,全程双视图同步操作,先看左侧二维图像,分清车辆行人,避开遮挡,锁定目标,系统自动匹配对应点云 切换,俯视测试,多角度拉三 d 立方框对照图片纹理调整长宽高摆正物体朝向,全部标完,三百六十度旋转点云全景自检,双向核对轮廓点位严控才切框偏移问题精度达标才能提交,大幅减少反攻。

做二 d、 三 d 融合标注,全程双视图同步操作,先看左侧二维图像,分清车辆行人,避开遮挡,锁定目标,系统自动匹配对应点云 切换,俯视测试,多角度拉三 d 立方框对照图片纹理调整长宽高摆正物体朝向,全部标完,三百六十度旋转点云全景自检,双向核对轮廓点位严控才切框偏移问题精度达标才能提交,大幅减少反攻。


快使用双节! 快使用双节棍,哼哼哈嘿!快使用双节棍,哼哼哈嘿!如果我 外面的马马上排绳有三段,来,老板,有服务器搞大数据,老板自我切关,从小就二入牡丹 os 干中国 啥子算法最喜欢极其学习,用处都连深度神经网络还样条,偶尔发狗, 数据清晰莫走开, 所有话题都来翻钱 三年你喜欢啥子?我就推荐找不到方向的人走路线。一张图片来一次三位重建,一句瓜娃子,我可以随便放言。 快使用节气宣泄。

哈喽,大家好,我是司马。今天八月九号了,这个成套的 facebook ai 的 课程呢啊,要花一些时间才能把它给讲完啊,它是一套完整的逻辑。上一节课呢,我们讲了机器人数据的清洗。我们知道机器人采集的数据呢,并不能直接用于训练, 必须经过时间同步、异常过滤、轨迹平滑和数据整理。但是呢,即使我们拥有了一批干净的数据啊,还有一个关键的问题, 机器人知道这些动作代表什么吗?例如我们给机器人一段数据啊,视频里呢,一只手拿起一个杯子,那机器人看到的是手移动,杯子移动,机械臂移动。 但机器人不知道为什么要这样做,这个动作对应的任务是什么?他不知道这是拿杯子还是移动一个物体,还是在整理桌面。所以我们需要进一步建立语言、视觉、动作之间的对应关系。 这就是今天的主题, data annotation 啊,也就是数据标注与语义对齐。为什么机器人数据需要标注呢?我们先理解一个概念, grounding 啊,中文通常翻译落地对齐,它的核心意思呢,是让 ai 把抽象的概念连接到真实的世界去。例如人说拿起红色的苹果,机器人需要知道红色的苹果对应现实中的哪个物体, 这就是 language grounding。 对 于机器人来说呢, grounding 主要是包含了三个链接,第一呢是语言啊,也就是任务。第二呢是视觉 物体,第三呢是动作结果。机器人训练数据包含什么?一个完整的机器人训练样本啊,通常会包括第一个部分啊, language isolation 啊,语言指令,例如把桌上的蓝色杯子放到盒子里, 它告诉机器人目标是什么。第二部分, observation, 观察数据包括了 rgb, depth, point and close, 告诉机器人环境是什么样子的。第三部分呢,就是 action, 动作,包括机械臂的位置,姿态,夹爪的状态,告诉机器人应该怎么做,最终呢,就形成了 enriches direction 到 observation action, 这就是 v l a 模型学习的基础。第一类标注,语言与动作的绑定。首先呢,机器人需要知道一句话对应哪个动作,例如语言是拿起苹果对应 episode, episode 零零一啊,机器人移动到苹果,抓取抬起 appstore 零零二,机器人移动到苹果啊,抓取失败, appstore 零零三,机器人拿起苹果。那么训练的时候呢,我们就需要告诉某些,这个指令对应的是 appstore 的 零零三, 这个过程呢就叫做轨迹语义绑定。我们上一节课学了 appstore 的是机器人数据里面的基本单位啊,上一节我们有提到,它代表的就是一次完整的任务, 例如任务是整理桌面啊, episode 呢,第一步看到桌面,第二步识别物品,第三步呢,机械臂移动,第四步呢,抓取,第五步呢,放置,这整个过程呢,就是一个 episode。 那 为什么需要 episode 呢?因为机器人不是预测单个动作,而是学习完成的任务逻辑,例如他看到杯子之后,下一步应该移动,移动以后呢,应该去抓取,抓取以后呢,应该去放置 啊,这就是第一类标注。第二类标注呢,是视觉与空间的标注,机器人不仅需要知道这是苹果,还需要知道苹果在哪里,所以需要视觉的标注,常见的包括二 d bundy box, 也就是二维框啊,就把它框起来, 例如图片中框出苹果高速模型,苹果的区域。第二种呢,就是三 d bounding box 啊,三维框啊,相比二维框呢,增加了深度信息,例如苹果的中心坐标 x y z 啊,尺寸长,框高啊,对于机器人去抓取的时候呢,三 d 信息呢,会更加的重要。 第三个呢, segmentation 分 割啊,这就更加精细了,例如把苹果的这个轮廓画出来啊,适合比较复杂的环境。 grasp point 就是 抓取点, 这是机器人特别关注的数据啊,例如苹果哪里适合抓中心还是顶部还是侧面模型呢?是需要学习的,学习最佳抓取的一个位置, contact point 啊,接触点,除了抓取的位置,机器人还需要知道接触的关系,例如手指应该碰哪里,甲爪应该接触哪几个位置 啊,尤其是对于灵巧手和柔性物体啊,接触信息是非常重要的啊。未来机器人呢,不仅需要视觉,还需要力觉和触觉。多膜态对齐是最核心的问题啊, facebook ai 最大的特点呢,就是多模态啊,同时呢,存在了视觉语言动作,那问题是如何保证它们对应呢?例如视频零秒的时候,是看到杯子一秒,手一动两秒抓住杯子, 语言拿杯子,那么模型需要知道这句话对应的零到两秒的这个过程,因此非常重要的就是时间对齐,也就是 time step element 数据增强 data annotation, 机器人的数据呢,非常的昂贵,所以我们希望一份数据产生更多的价值,这就是数据增强。数据增强的方法有三种啊,方法一呢,视觉增强,例如改变亮度,颜色,噪声啊,模拟不同的环境。 方法二呢,就是视角的变化,例如改变摄像头的视角,让模型适应不同的安装方式。 三呢,就是动作的扰动,例如加入轻微的轨迹变化,让机器学习呢,不是唯一的一个动作,一个抓取任务的数据标注案例啊。回到我们的这个 demo, 把红色的苹果啊放到左边的篮子 啊,原始的一个数据,首先呢,原始数据是有 rgb 的 视频标注语言呢, pixelify, apple 到视觉苹果的位置到空间啊,苹果的三 d 坐标到动作机械臂的轨迹。 然后呢,是结果成功,最终形成呢,一个完整的训练样本啊。为什么数据标注是机器人公司的核心能力呢? 很多人认为机器人的竞争呢,是拼模型,但实际上呢,未来的竞争可能会更加依赖数据的闭环,原因是模型可以开源嘛,算法可以共享嘛?但是呢,高质量的机器人数据需要什么?需要设备,场景和经验。例如一个机器人公司有一百万个真实操作的 app store 啊,它的模型能力呢,会不断的上升。一个完整的 facebook ai 的 数据流程啊,我们现在已经走到了这里啊, 第一步呢,就是数据的采集到,第二步呢,数据的清洗,第三步呢,数据的标注,第四步呢,训练数据集。第五步呢,模型的训练。后面呢,我们会进入如何把这些数据啊,组成一个模型真正能读的格式。 那今天我们学习。第一,为什么机器人需要数据标注?第二,三个核心对齐啊,语言,任务,视觉,空间,动作。结果。第三呢,机器人常见的标注, bending box, 三 d, pulse, press point, contact point。 第四呢,就是多模态的数据呢,必须时间同步,语义绑定。那总结一下啊,数据采集呢,让机器人获得经验,数据标注呢,让机器人理解经验,只有把语言,视觉动作连起来,机器人才能真正的学习技能。 下一节课我们的标题是格式化训练级构建从原始数据到 r, l, d, s 以及 lay robot 的 数据格式。 我们会讲机器人训练数据如何标准化,为什么 open ai, google, mate 等团队啊,都关注统一的数据格式,以及如何把 r, g, b, d 动作语言封装成模型,可以直接训练的数据集。我们下一课见,拜拜!

新手入门必看二 d、 三 d 融合标注该怎么操作?我们优先在左侧二 d 图像画面锁定标注目标,依靠二维画面看清物体轮廓,分辨遮挡区域,再联动右侧三 d 点云,切换多个视角,调整立方框, 对照二 d 图像纹理,照准框体尺寸,还有物体朝向。全部标注完成后,三百六十度旋转点云全景自检,双向试图交叉合影,就能有效降低标注反光率。

做遥感分割的同学应该感受到了,多模态融合着,摊子里冒头最快的是屏域融合。先说为什么难,光学 s a r 红外各是各的成像原理,一个被动反射,一个主动散射,数据天生不对齐。老办法在空间域硬融,融进去的是融鱼, 漏掉的是互补。尤其小目标细分的类别,精度怎么都上不去。最近 t g r s 二零二五那篇 f d m f net 思路挺刁,他不急着融,先把特征拆到屏域,低屏,留的是模态特有细节,拆完再用户信息,把融鱼压掉, 把低频对齐,最后拿低频当毛,去高频里挑有用的细节,合起来效果很直接。四个主流数据集刷到 s u t a w h o o p t s a r 上, m i o u 到百分之七十一点五七道路其他这种平时难分的类, 精度大概提了百分之十。欧洲城区 wakandan 百分之八十三点八二, pochdam 百分之八十六点四五。最讨喜的是好落地,它用 sega former 做出实化 单卡 a 一 零零就驯得动。代码 get up, 开源赋现不难。要是你想做小论文,不用从零搭,看个模块下手就行。屏域野马怎么姿势硬调户信息权重怎么设?地平引导怎么换,替换轻量化组合着来都能成文。论文资料包我整理好了,需要的同学我发你。

抖音被拉黑后,还有办法看对方视频吗?好,现在这两个是正常的好友关系。拉黑之前是可以进入对方的主页的,就是可以看到他的作品,现在我们直接把他给拉黑,右上角三个点,然后这边有一个拉黑,确认拉黑 好,我们再重新返回,然后进入他的主页,拉黑过后对方的主页是这样的,那么还有什么办法能够看到他主页的视频呢?我们先返回进入抖音设置, 然后往下边翻最下边一项退出登录退出。 好,现在我们点击右上角的放大镜,搜索一下对方的昵称,当然如果是抖音号更好, 好,又能看到他的作品了,我们点击进去就是这么简单,有这方面困扰的朋友可以去试一下。

露露,这个数会读吗?个位?十位,百位。哎,停停停,这样读太慢了。大数的读法第一步要先分级。对,从右往左,每四个数为一级,我们一起来分一分,一、二、三、四, 那么这四个数就叫做个级。个级继续往前,一、二、三、四这四个数我们称为万级。一、二、三、四这四个数我们就称为一级。 读的时候我们只需要从最高位开始,一级一级的往下读,每一级的读法都是相同的,只不过一级和万级我们得加上吉名,也就是一和万。 跟着老师一起读。三千四百七十九亿四千六百三十二万五千七百六十三。看不就读出来了吗?怎么样,会读了吗?哇,老师,我会了。