粉丝424获赞184


你这面试能过才有鬼呢,不可能过,你别看这数据标注简单,兄弟们,你想过还还未必行呢,就是你标嘛,对吧?有软件,这个软件呢有很多,我先说一下,通用类型特别多。就是通用类型的是简单说,谁都能用, 你也能用,我也能用,张三也能用,李四也能用,也能用,比如 label me, label image。 那 么这地方需要注意啊,就是我们如果接的是甲方的这个数据标注活你放心啊,是甲方,一般啊,都是甲方指定的 标注软件,他不会有通用的,他会给你指定好,你想要通用的门都没有啊,他给你指定好的。所以说呢,这些在市面上百度上你也找不到。都是指定好的啊,他们可能调整过,修改过,乱七八糟啊。不管,反正就是你找不到。所以面试时面试官会问你,哎,你们之前标注用的什么软件啊? 啊?回复是甲方要求提供的,比如经验面试官。有经验面试官团队多少人?三人啊,你这面试能过才有鬼呢,不可能过, 你别看数据标注简单,兄弟们,你想过还还未必行呢。然后这个软件呢?因为我就是 mac os, 安装不了哈,它只能 windows, 你 也不用问我为啥。我,我也不知道为啥甲方提供的它必须要 windows 标,我把这个下下来,然后一会传群里面,你们可以看看。 这是个正儿八经的项目,里边东西都有啊,不知八全好,紧接着还有呢,我们接了个项目呢,标什么玩意呢?它规则文档是有的啊,所以他也会问你,你们的标注规则是什么?好,这个等一会,一会再说啊,因为我还没下载完好。还有一个问题就是如何保证标注的准确率,你看啊, 你们公司有五十个人标对不对?你标完你不得交差吗?就交付,你怎么保证这帮人标的他对呢?有没有可能标错呢?当然有可能,那你怎么保证你带的团队 或者你们公司有什么机制就能导致啊?你准确率是百分之到,到到多少是吧?百分准确率不是那么低的啊,怎么样保证?这是一个一个话题,所以准确率很关键,就是你,你交付给甲方,你准确率不高,你得返工你,但是你公司得给人发工资啊, 所以你要保证准确率啊。那怎么样保证准确率?这个机制呢?叫爬坡机制,很简单,就是个漏斗,公司上来五十,要求五十人,不低于五十人,对不对?好,我上来招一百人。一百人干嘛呢?给一些数据,我先给他们做,第一,我先给这帮人做一个简单的培训。第二是 标,然后检查,是吧?那就有一些人被淘汰掉了,比如这剩八十个人是吧?然后再来一轮,可能就剩下六十个人,然后再来,对吧?就剩下比如说五十五人了, ok, 有 个爬坡机制。那这样的话呢,就是保证了这些人员都是经过我们一层层筛选的,认为是强兵,对吧?这个精兵良将 是吧?都,都是,都是已经考核过的,这叫爬坡机制。这样呢,来保证我们的第一步的准确率啊,就是标注前啊,正式标注前来一套爬坡机制。那么正式标注后有一个东西叫质检,面试时候面试官也会问你,你们质检的方式啊, 这些都了解就可以了啊,质检的方式有哪些好 问大家啊,你们家装修的风格什么风格啊?想必各位家里边风格都不一样吧,有的是这样风,有的是那样风,喜欢就可以,对吧? 说白就适合自己最好。 ok, 好 的公司也是一样,他虽然有很多置业方式,但是最重要的是适合好他有很多,比如双审机制,或者说叫抽样检查吧,特别简单。怎么说?标一百个 对不对?你这样交叉交了一百个,我抽,我抽你一百个,其中的十个,我来看看你怎么样检查部分作业。抽样检查, 这是第一种,第二种交叉验证。张三这个人,李四这个人是吧?你标了一百个,你标了一百个,你们俩,你们哥俩随便拿出来十个,你也拿出来十个,你检查他的,他检查你的,这个叫交叉。交叉 抽奖检查,交叉验证,这是普遍的质检方式,但还有个东西叫双审机制。双审机制是这样的,一人 做了一百,标了一百个,低于他做完一百个。做一遍,相当于说 b 检查 a 的 作业,你不是标完了吗?对吧?我也熟读标注规则文档是吧?我,你不是做完了吗?对吧?我我我,我就看看你的标对不对。叫双审, 他做一遍,他审一遍,其实就俩人,等于俩人围绕一百个都都就一百个数据做了做了,做了两次,叫双审机制。好,记住刚才所说啊,适合你最重要啊,双审机制是不是费人工啊兄弟们, 对吧?抽样检查是不是最轻松啊?没错,是要根据你们公司的场景、业务等等一些连来的,取决于你们要用哪个东,哪个机制来去做?好吧, 那普遍的这个这个数据标注啊,一般都用这两个机制就可以了啊,这个呢是大公司才会做的,因为这个数据他的你就,你想都不用想,这个准确率可能一定高, 你做个一万,就是你你,你一条数据你做个一万遍,他他他怎么可能准确率不高呢?那不开玩笑吗?对不对啊?所以他这个准确率高。 好,那面试官问到了你们,你们,你们这样数据标注是如何提高准确率的?好,首先这样的,我们正式标之前呢,有个爬坡机制啊,就是我们要求我们的,就是甲方要求我们团队人数不能低于五十人啊,一开始我们招聘一百个人,然后呢会有人 组长会讲一些标准规则文档啊,然后呢我们会视标,然后从一百人,比如说第一轮视标,剩下八十人再轮视标,升六十人再轮视标,比如升五十五人, ok, 这这五十个五个同事,我们就可以正式的去数据标注去了。 然后呢在做的过程中,呃,我们可能呃就给一批标个百分之三十,百分之四十左右的样子,我们都会有一个这个质检,那么质检方式呢?采用两种方式,一个抽样检查,一个是交叉癌症,那我们一般都会采用这个抽样检查。哎,这么去说他就知道啥意思。 好,这就是导证准确率。好,兄弟们说清楚了吧,那有问题吗?当然这个质检方式还有很多啊,我就不一一列举了啊,没有,没有必要,好吧,就是那些东西不主流,那咱们看标注规则是什么啊?下回分解。

如果你正在了解数据标注这条内容,建议认真看完,能帮你避开不少误区。我见过很多想入行的朋友,因为信息杂乱,走了不少弯路, 我在这行时间比较久,也经历过摸索阶段,今天就和大家分享一些增值实用的内容。处理标注简单来说就是为人工智能相关的数据做整理与标注,像图片、语音、文本这类基础数据 都需要人工完成规范标准。他属于多劳多得的技能型,工作需要细心和耐心,收入与熟练度、工作量相关,没有所谓捷径可走。新人比较常见的问题是对行业抱有不切实际的期待, 容易被不时信息误导或是基础不扎实就急于求成。能长期坚持的大多是沉下心,熟悉标准,永不提升的人。 我做这个账号没有其他套路,就是分享真实经验,帮助大家更理性的了解这个行业。想系统学习数据标注的朋友可以关注我,后续会持续分享使用干货。觉得内容有帮助,不妨点个赞收藏一下,方便需要时再回看。

一提数据标注就头大,磨人又低效,越标越心累。教你几个实打实的提效小方法,清楚管用。首先把标注规则和需求识透,提前理清标准,口考细节, 千万不要憋膘憋叉做反躬搏。然后同类任务集中做,别来回切换,避免反复熟悉规则,纯粹浪费时间。还有工具,快捷键熟练,能一键操作的绝不多结鼠标,少一步操作就少一分类。 最后,标注时要沉下心,专心做,不仅速度能提上来,出错率也能大幅度降低,早走弯路。这几招记牢用熟,标注又快又准,再也不用熬时间遭罪了。

二零二六年数据标注小白应该怎么进入?分为两点给大家去讲。哈喽兄弟们,今天咱们聊一聊数据标注小白应该怎么去选,订单 应该怎么去干,分为两点给大家去介绍。第一点,小白团队要进入这个赛道,那么对于标注的话,你要去选择智驾类型的订单,为什么? 因为我们每一个人,每一天他都从大马路上要行走,他的脑袋当中呢?他会有这么一个概念,他知道遇见绿灯他得行,遇见红灯他得停,这就是这么一个概念问题。 那么如果说你要做采集的话,采集你要去选择巨星机器人,为什么?因为今年的巨星机器人他在采集过程当中需要的数据都是比较简单的,比如说一些抓取动作,把桌面上的某一个物品抓起来 放到哪里去,这就是聚生机器人的一个采集啊。那么第二个点的话,就是当你的团队他具有一定的影响力之后,哎,有一定的规模,有一定的经验,那么你可以去选择垂直领域,比如说医疗订单,为什么呢? 因为你的人你得有这么一个人群,就是说他有一个学医的这么一个基础,才可以去干医疗订单,你给一张片子,你能看懂他是骨折了,到底还是肌肉拉伤了? 那么小语种的话,你比如说现在我们接触到了,比如说是这个藏区藏语啊,包括这个英语、韩语、俄语等等一系列,你得有这样的人群,你能听得懂,你才能翻译过来, 那么这个就需要你的公司有一定的资源,或者说有这个影响力,你才能接到这样的订单。

上期视频咱们说了数据标注里的拉块,那么今天咱们来说数据标注里边的打点。嗨,大家好,我是九零后的宝妈, 我是从一八年开始接触数据标注的,今天我来给大家讲数据标注里边的打点。打点呢,他就是给图片或者视频里某个目标的关键位置打上一个或者多个关键点, 它呢只用标注点的位置,不用勾轮廓,不用画矩形框。它呢主要就是用来告诉 ai 某个部位的一个关键位置,比如咱们这个是眼角、眼尾、鼻尖, 它的目的呢有以下三点,首先第一点让 ai 精准识别物体的位置、姿态以及结构。第二个呢就是用于人脸识别人体姿态、手势还有车辆关键点等的一个模型训练。第三个呢,就是为 ai 提供一个精确的位置参考,实现检测 姿态以及跟踪的一个判断。由于时间关系呢,今天就先给大家分享到这里,明天咱们接着分享数据标注。

有很多人问我数据标注是干什么的?是不是很高级?是不是很难?他靠谱吗?大家好,我是九零后的宝妈,我是从一八年开始接触数据标注的, 我主要做的就是分割跟拉框,当然其他类型的数据标注我也是了解的。现在呢,我就带大家简单去了解一下这个数据标注。 大家都很熟悉 ai, 那 么 ai 呢?他就是一个什么都不懂的小孩,而我们就是给他批改作业,教他认东西,相当于是他的老师。 ai 是 那个小朋友,而我们就是那个老师给他启蒙的老师。简单来说,没有数据标注, ai 就是 个小笨蛋。由于时间关系,今天就先分享到这里,明天我会接着给大家分享更多有关数据标注的信息。

韩式做点云拉框脑补,总做不标准,频繁出错,阿迪标准精度,今天我就以车辆标注为例,带大家吃透完整的脑补拉框规范。 首先,宽度脑补,我们优先遵循对称原则,能看见一半车身宽度,就以这一半为基本,左右对称,不缺拉框。 如果典型残缺,没有对称参考依据,就严格按照车型标准尺寸去脑补。其实长度脑补,顺着车辆原有轮廓自然延伸,贴合车身真实结构,补全车头车尾,保证整体比例协调,逻辑合理。最后,高度脑补, 框底一定要紧贴地面,绝对不能悬空车顶高度匹配对应车型,把控好合规合理的高度即可。按照这个方法去做点圆拉框标注,规范又精准,再也不用反复修改返工。

用一百期讲懂 ai 大 模型架构。大家好,今天我们聚焦大模型数据标注结构化。我们都知道大模型的训练需要高质量、标准化的数据,而原始数据不管它是真实的还是合成的,往往都是杂乱无章、非结构化的。 比如说随意的文本、模糊的图像,无需的音频,没有办法直接用在模型的训练。数据标注结构化就是将这些非结构化的数据转化为结构化、 标准化、可识别的标注数据,为大模型的训练提供核心的支撑,其标注的质量呢和结构化的程度也直接决定大模型的推理精度和泛化能力。首先我们要明确一个核心的定义,大模型数据标注结构化 是指基于大模型训练目标和算法的需求,对非结构化的原始数据,比如说文本、图像、音频、视频,通过人工标注、半自动标注、自动标注等方式,添加标签、分类、注视边界框等信息,将它转化为具有明确的结构、明确的含义、 模型可识别的结构化的过程。简单的来说就是给杂乱无章的数据贴标签、定类别、划边界,让大模型能够去理解 整个词句的含义、特征和规律,从而高效的去完成训练和推理任务。需要重点强调的是,大模型的数据标注结构化并非简单的贴标签,而是一系列的系统化的工程, 核心的目标是实现数据的结构化。标准化能确保标注信息准确、完整,又能保证标注格式标准化。适配大模型的训练算法和框架,以及不同的模态的数据 标注化的方呢要求也存在着差异,今天我们将围绕大模型的三个模态,数据、文本、图像、音频来去拆解结构化的核心方法流程,以及关注视线,我们下一期见。

挑战用一百期讲懂 ai 大 模型架构,我们今天分别拆解文本、图像、音频三大模态数据的结构化的流程方法,那这也是大模型数据标注结构化的核心内容,精准的去适配不同模态数据的训练需求。第一是文本标注数据结构化,这是大模型训练的一些必要的处理环节, 核心的目标是将无序的这样的一些文本数据转化为具有明确定义标准的结构化数据。核心的流程第一步是文本的预处理,对原始文本进行去重、降噪、分解,剔除无效的字体,规范文本的格式。 二是标注整个任务的定义,根据模型训练的目的,明确他的任务,比如说是实体标注,就像文中的一些地名、机构情感标注,正面、负面、中性的情感 笔译、标赋,比如说它的含义、逻辑关系、分类标注。第三是标注的实施,要采用人工半自动和全自动的标注方式,按照标准对文本进行数据标注对应的一些标签。四是审核,那对标注的结果要进行审核和修正,来确保整个标注准确和完整。 五是格式转换,对标注后的文本信息转换为模型可识别的、自动化的格式,便于模型去读取和训练。核心的方法包括实体标注的一些核心的代表,那情感标注则是采用这种标签标注。 第二,图像标注的结构化,这是多模态大模型图像大模型训练的核心数据处理环节,核心的目标是将模糊无序的数据转化为明确的目标、明确的边界、明确的 核心的流程包括,一是图像预处理,对原始图像进行模糊、去重尺寸、统一归一化等处理规模像,规范图像的格式。二是标注任务定义,明确标注的任务,比如说目标检测的标注,羽翼分割标注,然后图像分类标注关键点进行标注。 三是标注实施,采用人工半自动或者全自动的标注方法,比如说目标检测,然后采用这种边框镜像的标注。羽翼分割标注就是采用区域划分标注, 添加对应的标注标签。四是标注审核,审核标注边界的准确性,然后以及类别标签的正确性,修正他整个标注的错误。五是格式标注,将标注后的图像数据和标注的信息转化为模型可识别的格式。

今天,我必须为数据标注好好证明一下啊!很多人一听到数据标注,第一印象就是低端的流水线,没有技术门槛,纯体力活,随随便便贴贴标签就行了。其实呢,这都是老观念了,早就过时了好吗?现在的数据标注早就不是简单的 低端的代工了好吗?而是 ai 大 模型发展的重要基石,更是人类人工智能行业的幕后英雄。给大家通俗讲一下,到底是做什么的,就比如说我们平时用的 ai 聊天、智能识别、自动驾驶、线上问诊等等,都是通过 ai 数据诞生的。 刚诞生的 ai 就 像一张白纸,什么都不懂,不会分辨对错,只会乱讲话呀!而数据标注员呢,就是手把手教 ai 成长的人,帮 ai 梳理指令,标注那个专业的信息呀,判断对错,守住安全红线,打磨更贴合人体语言的逻辑的, 让 ai 变得就是听得懂、会办事,够专业,够安全。可以说,如果没有数据标注的话,再厉害的 ai 都只是一个 空架子,这可不是昙花一现的小行业哦,而是现在 ai 产业的核心基建,就业稳定,发展空间很广的,人才缺口大,是妥妥的朝阳赛道哦!

有很多人问我数据标注是做什么的,似乎很高级,它很难吗?大家好,我是九零后的宝妈, 我是从一八年开始接触数据标注的。今天我来给大家分享一下数据标注的种类,有羽翼、分割、拉框、打点图片、筛选文本等等。而我呢,主要做的就是分割跟拉框。如果你是数据标注员,那么你会选哪一种呢?

三 d 点云标注用来训练自动驾驶智能车路感知的 ai 算法,让无人车能精准感知周围三 d 环境,判断距离、规避风险是自动驾驶落地最核心的基础。

想做数据标注的新人注意这三个误区,一定要避开,尤其是第三个, 很多刚入行的朋友都会碰到。第一,别一上来就轻信各种高收入说法,也别随便交钱,不少人交完钱干几天就没人对接了,鞋盒时间都白费。 第二,别随便找个平台去做,平台选的不合适,做出来的标准容易无效,等于白忙。第三,也是最关键的一点, 没知道规则就着急上手,不然容易反复反攻,越做越没信心,甚至坚持不下去。 其实刚入行第一个月,收入普遍不会太高,这很正常,我也是这么一步步过来的,今天就把这些真实经验分享给大家,就是希望大家少走弯路, 想踏踏实实入行少踩坑的点个关注,后面会继续分享真实的入行方法和避坑经验。

大家好,欢迎来到本期 ai 算法演示,继前两期我们成功实现电动车自动标注人脸特征算法模型的演示之后,今天我们继续发力,带大家实现管治刀具的自动标注, 解决标注行业里刀具标注繁琐、效率低的核心痛点。为了适配不同的使用场景,我们这次做了两个版本的模型,大家可以根据自己的需求选择。 第一个是低精度版本,目前已经能满足基础的粗糙的自动标注需求,适合对精度要求不高,追求标注速度的场景。第二个是高精度版本,也是我们重点优化的版本,精准度和识别效果都有大幅提升。我们先看低精度版本的演示效果, 现在我整理了四张图片,包含不同管制刀具的图片,有清晰的,有轻微模糊的。开始标注脚本运行后,模型会快速运行, 自动识别画面中的管制刀具,并且完成框选和类别标注。大家可以看到标注速度很快,批量处理四张图片,两秒钟就能完成。不过低精度版本的不足也很明显,似图中明明只有一把刀具,但模型却返回了两个标注。接下来是我们的高精度版本, 也是重点推荐给大家的版本,同样导入刚才那组图片,大家可以直观看到区别高精度版本的标注,如图中的四张图片,都能精准识别,没有漏标的情况。 这里给大家公布一下我们的实测数据,高精度版本的精确率达到了百分之九十五点二二,召回率是百分之八十九点三零。可能有朋友会问,召回率为什么不是百分之一百?这里跟大家说明一下。召回率偏低主要是受样品质量的影响, 如果图片过于模糊,道具被严重遮挡,或者样品类型超出我们的训练范围,就可能出现少量未识别的情况,后续我们也会持续优化。