粉丝282获赞375

作为一名工程师,你每天要面对多少离职?几万行,几百万行,是不是感觉像在一堆乱麻里找线索,眼睛都快看花了?尤其是系统一出问题,绿纸就是唯一的救命稻草。 但元数律制本身,说实话对机器来说就是天书就是天书,他们格式五花八门,混杂着各种信息,根本没法直接拿来做分析。我对此深有体会。我记得有一次为了匹配一个奇葩格式的 java 堆栈跟踪日制,那个正则表达式,我写了差不多五百个字母, 跟乱码一样。哈哈,我懂。过了一个月,连我自己都看不懂了,每次出问题都得从头再来。所以在做任何有意义的分析之前, 我们都得先做一件事,就是律制解析, log parsing。 没错,律制解析就是把那些人看的非结构化的律制文本,转换成机器能懂的结构化的数据,这是所有后续工作,比如异常检测、根音分析的基础。四十九点二,四十九,七百三十一 info main arc d n apache d n d f s d n d f s client successfully connected to ten point one ninety point one seventy three point one seventy five zero zero one zero for block 幺零七三七四二零八二零二基尼西一。嗯,很典型的一行绿质,经过解析,它就会被拆解成几个关键部分。四十九点四十九,七百三十一,然后是绿质模板,也就是这行绿质里不变的静态的部分, 可以概括为 successfully connected to four, 就是 把变量挖出来。对最后那些会变化的部分,比如具体的 ip 地址和区块 id, 就 作为参数被提取出来。对最后那些会变化的部分,比如具体的 ip 地址和区块 id, 就 作为区块和统计了。 但问题就来了,怎么实现这个自动化的解析过程?像我刚才说的,手动写正则表达式,费时费力,还容易出错。系统一升级,律制格式稍微变动一下,值钱的规则可能就全废了。是的,而另一些传统的基于磁品的统计算法,它们的核心逻辑很简单,出现次数多的词是模板, 出现次数少的是参数。听起来很直观。这种方法在简单的系统里还行,但面对现在复杂的微服务架构,日制里充满了各种 u u i d 哈希值临时端口,它就很容易判断失误。 根本原因在于这些老方法缺乏对日制语义的理解。说到语义理解,那我们工程师的脑子里现在可能立刻会跳出一个词儿,大语言模型 l l m。 没错, l l m 这么强大,让他来读懂日制,提起模板,听起来不是顺理成章吗?但这里面有个致命的问题, 如果你的系统一天产生一亿条日制,难道要调用一亿次 l l m 的 api 吗?这不可能的,别说成本了, 光是等着它返回,结果黄花菜都凉了。这正是目前所有想用 a l m 解决工程问题的人都会遇到的核心矛盾。我们既渴望 a l m 的 智慧,又畏惧它昂贵的代价。没错,这就把我们带到了今天要深入探讨的这份研究。 l l m, 它来自哈佛大学和阿里巴巴的研究团队,我觉得它给出的答案非常漂亮。嗯,它的核心使命就是如何既能利用 l l m 的 强大能力,又能巧妙地避开它的效率陷阱, 实现一种高效、精准,而且几乎不需要人工干预的日式解析方案。我们一起来拆解一下它的设计。好的,好了,我们来看看 logparser llm 到底是怎么做的。 我觉得它最巧妙的不是它用了 llm, 而是它想尽了办法去不用 llm。 哈哈,这个总结非常到位。它把昂贵的 llm 当作一个轻易不能动用的王牌, 设计了一套非常高效的系统来处理九十九 per 三的常规工作,这才是整个设计的精髓。对,它确实是一个混合动力架构。你可以想象它有两个核心组建在协调工作,一个是非常快的基于与发的初筛系统, 在论文里它叫前缀树,前缀树,另一个才是那个聪明的专家大佬,也就是基于 a o m 的 模板提取器。所以,当一条新日制进来,它不是直接被人给 l o m, 我 猜它会先经过那个前缀树初筛系统,对吧?完全正确,这个前缀树里存着所有已知的日制模板。是这样 流程是一条新日制进来,是否先对它进行分词,然后这些词源也就是 tokens 会沿着前缀数的路径去米配。这个过程本质上就是内存查找速度飞快。嗯,然后就会出现几种情况。 最理想的情况应该就是这条日制的格式。我们以前见过在前缀数里能找到一个一模一样的模板。是的,这在论文里被称为严格匹配 strict match。 如果系统在树上找到了一个完全匹配的已知的模板,那么这条日制就会被直接归入这个模板对应的日制粗里。然后呢,最关键的一点是,在这种情况下,根本就不需要调用 a l l o m。 而对于一个稳定运行的系统来说,绝大多数的日制都属于这种情况,都是在重复已有的模式。我明白了, 所以只有在初筛系统搞不定的时候,才需要把专家请出来。比如来了一条格式完全没见过的日制。正是如此, 当出现宽松匹配或者无匹配 no match, 也就是前缀数里没有完美的对应模板,这才是 lolm 登场的时机 哦。系统会把这条新的不认识的日制发送给 lolm, 利用它强大的语义理解能力,让它去提取这条日制背后的通用模板。 我猜 l l m 给出新模板之后,西冯肯定不能就这么算了,他得把这个新发现记下来,更新到那个前缀数里,对吧?对,这样下次再遇到类似的日子,就不用再麻烦 l l m 这位专家了吧?完全正确, 这就像一个能自我优化的动态知识库, l l m 返回新模板后,系统会用它创建或更新一个日制粗,并把这个新模式同步更新到前缀数的结构里,为后续的日制提供快速匹配。对,所以你看,这个设计直接将 l l m 的 调用次数从日制总行数这个量级 降低到了约等于日制模板的种类数这个量级。哇,这一下就把开销降了好几个数量级,成本和效率的问题基本上就解决了。这个设计确实很聪明, 他建立了一个动态的能自我优化的规则库,大部分时候都靠快速的规则匹配,只有在规则库知识不够用的时候才去求助那个昂贵又聪明的大脑。嗯,但问题又来了,效率是高了,可解析出来的结果到底对不对呢? 这里研究人员又发现了一个更有意思的问题。是的,这个问题可能很多工程师在实践中都模模糊糊的感觉到过,但很少有人能把它清晰的定义出来。是什么呢?研究者发现, 就算模型解析出的模板在逻辑上是完全正确的,但有时候和精准 data set 里的标准答案并不完全一致。哦,这不是因为模型错了,而是因为大家对正确的定义,也就是解析力度。 regularity of log processing 本身就存在差异。解析力度这个词很有意思, 论文把力度拆解成了两个相互制约的维度来历,解,特异性和适用性。特异性和适用性 x one initialized by client a 好 的 y two initialized by client b。 第三条 session dot z initialized by client b 好 的。三条日制。 区别在于会宣传 id 和客段名称。现在至少有两种正确的解析方式。方式一,我们可以生成两个模板,两个 initialized by client a。 第二个是 session dot, initialized by client b。 哦,我明白了,你看这种方式,把客端 a 和 b 看作是模板的固定部分。这样做的好处是模板非常具体,也就是高特异性,但坏处是每个模板的适用范围很窄,也就是低适用性。我明白了, 这种方式保留了客端信息在模板里。那另一种方式呢? initialize by client dot。 啊哈,这里把客端 a 和 b 都看作是动态参数,这个模板就更通用,适用性更高,但它丢失了客端名称这个具体信息,所以它的特异性就比较低。所以 哪一种才是对的?我感觉这好像取决于我的需求。对,如果我下游的监控任务特别关心是哪个客端惹的祸,那方式 e 更好。 但如果我只是想统计一下总共有多尔兹绘画出土画,那方式二就足够了,而且更简洁。你完全说到了点子上,不存在唯一的正确答案。嗯, 传统的准确率举标,比如解析结果和标准答案是不是字幕串完全匹配,在这种情况下就失灵了?它没法衡量这种合理但不同的差异。那研究者是怎么解决这个评估难题的呢?总不能说都对就算了吧。 他们提出了一个非常巧妙的新度量标准,叫做力度距离 granularity distance 力度距离这个指标的思路变了,他不再问你对不对,而是问你的解析结果和我的标准答案思路差了多远。哦,这个有意思。 具体来说,他计算的是需要多少次合并模板或者拆分模板的操作,才能让两种结果对齐?嗯,这样一来,对力度的评估就从简单的对或者错,变成了可量化的远或近。这对于工程实践来说,意义大多了。这个力度距离的概念确实解决了评估上的一个大难题, 但说到底,理论再完美,最终还是要看他跑起来怎么样。对于工程师来说,最关心的无非就两个字,效果。对他到底够不够快,够不够准。当然,我们直接来看数据 论文在一个叫 lock pop 的 大规模真实数据集上做了测试,这个数据集包含了十四个不同的系统,平均每个系统有三百六十万条日制,三百六十万条日制。按照之前的混合模型逻辑, l l m 的 调用次数应该约等于日制模板的数量。那一个真实系统里的日制模板能有多少种? 几百种?上千种?你猜的这个数量级很接近。而实验结果是,处理着平均三百六十万条日制 lock parcel l l m 平均只需要调用 l l m a p i 二百七十二点五次。等一下,从三百六十万到不足三百次, 这个降幅也太夸张了吧。我们来做一个更直接的对比,让你感受更强烈一点。如果采用最笨的逐行调用 l l m 的 方法, 那就是三百六十万次调用。嗯,研究团队估算了一下,用 gpt 三点五模型,不考虑任何网络延迟和 api 数据限制,跑完这些日制大概需要二十二天。二十二天, 一个紧急的线上问题,等二十二天才分析出日制公司都没了,这根本不具备可行性。那么 logparser llm 呢? 即使用更强大也更慢的 gpt 四模型出力完这三千六百万条日制,总运行时间平均也就在二十六分钟左右。二十二天对比二十六分钟对,这已经不是量级的差别了,这是能用和完全不能用的差别。是,二十二天意味着这个方案在真实生产环境里根本没有可行性。 而二十六分钟意味着我今天下午就可以把它部署到我的预处理流程里,明天就能看到结果。效率的巨大提升,证明了这个方法的现实可能性,接下来看准确性,毕竟快而错是没用的。对,这里有两个关键指标, 第一个叫分组正确率 fga, 简单说就是它有没有把所有相似的日制都正确地归到一类。 在这个指标上, logparser llm 比之前最好的方法提升了四十八点三, percent 提升了将近一半,说明它分得非常准。第二个叫模板正确率 fta, 也就是它为这一类日制提取出的通用模板,对不对? 这个指标提升了三十二点零, percent 也很高。这两个数字加起来,说明它不仅分得准,总结得也好, 更让工程师省心的是,它几乎不需要针对不同的数据集去调什么超参数啊。这个好,你不用为每个新的日制员去痛苦地调整余值,它通用性非常强,这绝对是个福音。但如果我对解析力度有特定要求呢?比如,在我的业务里,我就是希望把 client a 看做模板的一部分。 论文也考虑到了这一点,提出了一个孝准版本,叫 logparser l m c c 代表 calibrated 孝准版。它利用了大语言模型的上下文学习能力,你只需要提供极少量的,比如三十二个你亲手标注好的日制样本作为例子,微给他看,才三十二个样本,这工作量完全可以接受啊! 等于说,我只要花几分钟给他几个范例,告诉他呐,这就是我想要的解析风格,完全正确。有了这三十二个例子作为参考,模型的性能还能进一步大幅提升, 这为人机回路谱的应用提供了非常好的思路。嗯,作为工程师,你可以用极小的代价提供少量高质量的范力来引导模型,达到你期望的解析力度,实现非常定制化的解析效果。好的,我们来总结一下。今天我们深入探讨的 log parcel lm 给我们展示了一个极其清晰和聪明的思路。他们没有把 l l m 当做一无所不能、包打天下的黑猴儿,嗯,而是把它定位成一个拥有强大语义理解能力的专家组建,然后用高效的传统算法,也就是前缀数 来充当一个屎调系统?对,只在最关键最需要语义判断的时候才去向这位专家求助。对于工程师来说,这意味着未来在处理日制这类问题时,可能真的不再需要在手动写规则的繁琐和纯 ai 模型的昂贵之间去做那个艰难选择了。嗯, 有了一个鱼与熊掌兼得的方案。是的,而且这个高效算法 plus l l m 专家的混合模式,它的启发意义远远不止于日制解析。它启发我们思考一个更深层次的问题,没错, 在你自己的工作中,有哪些任务目前是依赖于大量繁琐的基于规则的系统,但同时又需要一定的鱼意理解或智能判断才能做得更好?我想想, 比如教验一些复杂的配置文件,或者在代码审查里自动识别一些不好的编蠢模式,有可能甚至是做告警。收敛理解哪些告警其实说的是同一件事,这些场景似乎都符合这个特点。完全可能。 你可以思考一下,是否可以借鉴 logparser l l m 的 思路去设计一个类似的混合系统,用传统高效的算法处理掉九十九趴的常规情况,保证系统的低成本和高吞吐量。嗯, 只在遇到那一趴的规则无法覆盖的疑难杂症时,才去召唤大语言模型这个强大的外援来解决。这或许是 l l m 在 工程领域除了直接做聊天人播之外一条非常务实和高效的落地路径。

拥抱 ai 人生,享受机械飞升!大家好,我是 sky。 今天开始,我们将要进入 r a g 系统的核心环节 retrieval 解锁。 因为解锁是核心环节,而且它的内容会非常丰富,所以我们会花几个视频把这一部分说完。首先,我们先来看看什么样的数据是企业拥有,而且 r a g 系统要去进行解锁的。大体来看,我们会分为两类数据,分别是结构化数据跟非结构化数据。这两类数据也有很多的差别,首先,结构化数据往往是以信息的形式存在的, 而非结构化新数据往往是知识。其次,它们存储的地方也不一样,结构化数据通常存在一个类似于表格的文件当中, 有些公司可能会采用 excel, 当然有 excel 并不代表就有结构化数据。很多时候 excel 表当中存在的数据其实是不可用的,甚至是打双引号的垃圾。而在我们的 r a g 系统当中,特别重要的一个点就是 garbage in, garbage out, 你 给他垃圾,他就会给你生成垃圾。所以后续我们会提到 excel 表的清洗特别重要。呃, 有些公司跑得更快一点,他们可能已经开始在用多维表格,或者说一些结构化数据库,而非结构化数据往往是存储在一些文件说明文档,当然也有专门的一些数据库可以用来存储。第三,他们的区别往往表现在企业现在到底有没有很多企业其实都有结构化的数据,它现在已经以文件的形式存在企业的整个系统。 但是很多非结构化数据其实目前还存在,可能一部分高管的脑子当中,最后也是二者的核心区别就是表现形式,结构化数据往往表现出字断对直的一个 pair。 比如我们今天还是一家卖车的公司,我们可能车会存在品牌是保, 那么系列可能是七系,然后具体的型号可能是七三零价格。所以我们会发现,结构化数据通常遵循着自断对直这样的一个对应关系。而非结构化数据它就比较丰富了,比如它可以是一些文本,宝马特别适合开奔驰,特别适合坐特斯拉,是三电系统非常好的一款电车, 或者说它可能是一些临时的企业的知识,比如下个月开始,宝马一律打九折。所以大家会看到结构化数据跟非结构化数据,其实它们的区别还是一目了然的。而我们本篇视频内容的核心是帮助大家去深沉和清洗结构化的数据。首先来消除大家一个最重要的误区, 有 excel 不 等于有结构化数据。通常情况下,在一个企业内部, excel 表现出来三大问题。第一大问题,他们可能来自于不同的人和不同的部门。举例来说,我这个文件夹里面的三个 excel 表就来自于不同的部门,而他们说的是相同的事情,那我到底应该听谁的? 第二个问题, excel 表格会存在着版本管理的问题。现在假设这三张表格不是来自于三个部门了,而是来自于一个部门,甚至同一个人,这个人在不同时期,他对表格的命名方式都是不一样。那么回头看的时候,应该用哪张表作为我最新的表格呢?很多时候 我们就会混乱,这两个问题统一表现出来的叫做企业缺乏关于某一项信息,或者说某一个表格的唯一真源。 第三,假设这个唯一真元是存在的,比如这个报价表二零二六零幺二四就是我们的唯一真元,它的内部也会存在很大的问题。我们会发现,正如我们企业当中很多 excel 表,这个 excel 表有非常多的问题。第一个问题,大量的使用了合并居中。 从视觉的角度来说,可能这样的合并居中让人感觉很舒服,但是在用起来它会给我们造成阻碍。举一个例子,如果这里的宝马并没有合并居中,我们是可以通过统计 a 列所有的宝马数量,得知我们企业库中有多少辆宝马,比如现在是十辆,但是因为我把它合并居中了, 导致我在统计的时候宝马就出现过一次。同样的,这个二零二六一月报价表也是一样,我的系统可能去到每一个表,它的第一行都是表头,就去到你这个表的时候,前两行变成了一个标题,而这个标题实际上应该写在文件,甚至是这个 sheet 的 位,不应该写在表格内部。所以第一大问题,合并造成了我们很多时候 系统在读取表格的时候出现读不清的情况。第二大问题,格式的不统一。比如我们看价格,这两列两个部门,一个部门用价格,另外部门用价格,括号 one, 结果大象禁停,甚至不存在可比性。 即使我们在同一个部门都用价格的情况下,不同人填写的标准不一样,有些写了整个的数字,有些带了个单位 one 啊,甚至简写了个 w, 甚至有些人可能会在前面加上一个人民币的符号,或者美元的符号, 当然他们是出于好心,但这导致了这个数据实际上是不可用的。比如我现在如果想按照地列对它进行排序,对不起,这是做不到的。那我们再看这个入库日期,日期也是一个格式的重灾区。这四种写法可能都没问题,但是放在一起都是问题。 所以我们需要有一个统一的格式,甚至是统一的数据类型,比如价格,它就应该是个数字,这样我们就不存在在前面写我的货币标记,在后面写一个汉字这样的一个写法。第三个问题体现在应该原子化的信息没有原子化,比如这里的颜色大家会看到,哎,我们可能有很多种写法, 事实上是把本来可以原子化的信息变成了一个文本性的描述,是一个非常大的障碍,切记要减少文本性的描述。 我们大可以把它抽出来叫做外观颜色和内饰颜色,这样我们就可以在具体的里面去写对应的颜色就好了。红白,甚至一个更好的做法是,我们应该把这样的一个东西变成单选项,我不是让你去填红,因为可能还是有会有人会填红色,对吧?大红等等这些我是把它变成一个选择题,你只能在我的红橙黄绿青蓝紫黑白这些东西当中做选择,而不是由你自由的去做填写。 四个问题,在表针同样意义的不同表的时候,可能它会出现列不同,比如在这里我们是有颜色列跟里程列的,但是去到了这张表格,我们就有了一个叫做维修次数列和里程列,这张表丢了颜色列,这张表丢了维修次数列。 可能在我们现实生活当中,这是我在给两个客户进行报价,所以我做了两个不同的表格。但是我希望把它放给 r e g 系统的时候,如果 r e g 系统只读其中一个,它就缺失信息了,如果两个都读,它就混乱了,所以这也是我们的唯一真元表。也许解决的问题就是唯一真元表的列应该足够多,使得这些所有信息都在我的唯一真元表当中。 而我给不同客户的不同的展示,可能只是我的一个试图,或者我从当中截取了一些列的信息给它做展示。 所以大家看到这四个问题,造成了今天 excel 表格实际上是不能立刻拿来用的。这也是我说的,有 excel 表不等于有结构化数据,这个 excel 表就是营养辣枪头,中看不中用,这样的数据 是要进行清洗的。那么我们需要怎么做呢?事实上,企业的 r a g 系统需要的结构化数据并不是以 excel 的 形式存在的,而是以 data frame 的 形式存在的。 一个 data frame, 它最重要有三个板块,第一是表头字段,比如品牌。第二我们要去规定这个字段的类型,比如它是一个单选也好,它是数字也好, 不是让人乱填的。很多时候我们是要严格规定它可以填的内容,甚至是要求它只可以选择的。第三就是值,这是对应我的这个字段,你可以去填的值。好,那我们最终清洗出来的 data frame 就是 一个非常好的 data frame。 大家请看这里,我对刚才的 excel 做了数据清洗。首先,我们去除了所有的单元格合并,这在我们的 data frame 当中是不允许的。 任何一个单元格理论上都应该被填满,它应该是一个正正方方的表格形式,有行有列,每一个单元格都被填满。第二,我们对它们的数据的类型和填写的内容进行了要求。比如在品牌这里,它其实是一个单选项,它只能选择而不能填写。理论上,这里的选项 是由更高级的管理者去进行补充的。正常情况下,表格的填写人只进行填写,这里的系列年份都是这样,它都是单选。所以呢,我们就避免了大家会因为填写而填写错误。 而在价格这里,我们明确规定了它是一个数字啊,它是个 number 啊,是个数字,所以它只能填数字。日期这里明确规定了它的 field type 是 一个 date, 对 吧?是一个日期格式。外观颜色、内饰颜色,我们都对它进行原子化,有还是以一个文本的形式, 甚至是复杂文本的形式存在,那包括我们这里包含了几乎的所有列,这样就构成了我们的一个唯一真元。数据如果要改,我们就改这个唯一真元, 我们只认这个唯一真元,所有我们给出去的文件应该基于这个唯一真元,它可以是这个唯一真元的一部分。列没有关系,但是不要再做更多信息的修改,如果信息确认要修改,就改在这个唯一真元的文件上,这样我们也规避了多版本的问题。 好的,所以接下来你在企业当中应该做两件事。第一件事是把你现在已经有的 excel 表格拿出来,通过 python 去清洗成 一个可用的 data frame。 如果目前这样的表格还没有,从第一天你就应该创建一个 data frame, 确定好你的表头和每一个字段的类型,然后让大家开始填写,这样我们就有了一份非常可用的 data frame。 一个结构化数据给到我们的二 a g 系统。 举个例子来说,以后 ig 系统就可以轻而易举的找到。我想要找一辆二零二一年的宝马,它的里程数在五 万公里以内,因为我们把这些数据都进行结构化了,所以这个系统可以非常轻而易举的找到。但如果我们还在刚刚的 excel 里面,它就会涉及到非常多更复杂的内容理解,而不是简单的去做一些数学题就搞定了。一旦我们形成了自己内部的 data frame, 我 们就构成了一个非常坚实的结构化数据的基础。 即使我们不引入更多的非结构化数据,它也是一个非常可用的情况了。我就可以基于用户的问题到这个表格当中去找到他想要的答案,然后一起喂给 l l m, 给到客户一个相对来说比较满意的结果。 那么怎么样能够给到一个更好的结果呢?下一节我们将要去说数据的粗筛和精筛,帮助大家在结构化数据的基础上更好地找到用户想要的数据。我们下次再见。

什么是数据库?我们几乎每分每秒都在使用数据库。微信聊天、聊天记录存在腾讯的数据库里,淘宝购物、商品信息、你的订单库存数量都存在阿里的数据库里。刷短视频推荐算法背后,是在实时分析数据库里你的行为数据和海量视频标签。 数据库 database 简而言之,可以视为数字化的文件柜,是长期储存在计算机内有组织的、统一管理的数据集合。它用于存储和管理大量相关信息,并以结构化的方式提供数据访问服务。 数据库不仅仅是一个保管数据的仓库,更是一套管理数据的技术与方法。数据库与电子表格有什么区别?数据库和电子表格,例如 excel, 都可以便捷的存储信息。两者的主要区别包括,一、 存储和操作数据的方式。二、谁可以访问数据。三、可以存储多少数据。一开始,电子表格就是专门针对单一用户而设计的, 其特性也反映了这一点。它非常适合不需要执行太多高度复杂的数据操作的单一用户或少数用户。相反,数据库的功能就强大多了。 数据库做的第一件事是结构化存储数据,不是一坨一坨的堆在一起,而是按规则来存。比如表行列,哪一列是什么类型,能不能为空都有明确约定。这样一来,机器才能高效地查人,也能理解数据的含义。第二件事是快速查询。 数据库不是只会存,它最核心的能力是查得快。你查某个用户、某一条订单、某一天的数据,数据库会通过锁引缓存执行计划,尽量用最少的时间把结果拿出来,这也是数据库和普通文件最大的区别之一。 第三件事是并发访问。一个 app 可能同时有成千上万人在用,大家都在查数据、改数据。数据库要保证不会互相覆盖,不会读到一半的脏数据,不会因为一个人出问题所有人都卡住。 第四件事,保证数据一致性。遵循严格的规则。比如银行转账时,它确保从 a 账户扣款和向 b 账户加钱这两个操作必须全部成功或全部失败,绝不会出现钱扣了却没到账的情况。这就涉及到数据库里一个很重要的概念事务。 简单理解事物就是要么全部成功,要么全部失败,比如转账、扣钱和加钱,要么一起完成,要么一起回滚。数据库会帮你把这些复杂的事情兜住。第五件事是数据安全和可能性。数据库不是靠运气存数据,它会有日治备份恢复机制, 哪怕服务器突然断电,进程崩溃,只要数据已经提交,数据库就尽量保证不丢。所以你会发现,数据库存在的意义只有一个,让你放心用数据。那数据库都长什么样?第一种 关系型数据库,最常用、最基础的类型,比如 sql、 oracle, 它就像 excel 表格数据都是有行有列的结构化数据,比如客户信息表,适合存有固定格式的数据, 我们平时用的 a p p 网站背后大多是这种数据库。第二种非关系型数据库,比如 mongolia b reddis, 它不像表格那样有固定格式,更像一个杂乱的储物箱,适合存非结构化数据,比如图片、视频、聊天记录、 朋友圈文案,这些数据没有固定格式,没法用表格分类,非关系型数据库就能灵活存储,而且读取速度更快。 比如你刷短视频时能快速加载图片视频,背后就有非关系型数据库的支撑。最后总结一下,数据库是几乎所有现代软件应用的记忆中疏和数据基石。没有数据库,互联网服务、移动 app、 企业信息系统都会瞬间瘫痪。 它把我们从杂乱无章的文件堆和缓慢的手工操作中解放出来,通过结构化存储和智能管理系统,让海量数据变得可被快速解锁、可靠共享和深度分析。好了,本期的分享就到这里,如果觉得有帮助,别忘了点赞、转发和收藏,我们下期见!

标题,结构化数据与非结构化数据的差异及其应用场景探究营研在大数据时代,数据成为了决策、分析和创新的关键。数据可以分为结构化数据和非结构化数据两大类,他们在数据处理、存储和分析方面有着显著的区别。 本文将深入探讨这两类数据的特性及其在不同领域的应用场景。易结构化数据的特点与应用 结构化数据是指可以使用关系型数据库表示和存储的数据。他以二维表的形式存在,每一行代表一个实体,每一列代表实体的某个属性。 这类数据具有明确的模式和结构,使得查询、修改和数据分析变得相对简单和高效。在应用场景上,结构化数据广泛应用于金融、电子商务、企业管理等领域。例如, 在金融行业,银行可以利用结构化数据来管理客户信息、交易记录和账户状态,从而实现高效的金融服务和风险管理。在电子商务领域,商家可以通过分析结构化的销售数据来预测市场趋势, 优化库存管理和营销策略。二、非结构化数据的特点与应用与结构化数据不同,非结构化数据没有固定的数据模型和结构,他们通常以文本、图像、音频、视频等形式存在。 这类数据包含了丰富的信息和潜在的价值,但处理和分析的难度相对较大。非结构化数据在社交媒体、 医疗健康、安全监控等领域有着广泛的应用。在社交媒体上,用户生成的大量文本和图像数据可以帮助企业了解消费者需求和市场趋势,从而 制定更精准的营销策略。在医疗健康领域,医生可以通过分析病人的医疗图像和病例记录来辅助诊断和治疗。在安全监控领域,非结构化数据如视频和图像可以用于人脸识别、行为分析等,提高安全保障水平。 三、结构化数据与非结构化数据的融合应用随着技术的发展,结构化数据和非结构化数据的融合应用成为了新的趋势。例如,在智能制造领域,通过将结构化的生产数据与非结构化的设备图像、视频数据相结合, 可以实现更精准的设备故障预测和维护。在智慧城市建设中,结构化数据如交通流量统计与非结构化数据如监控视频相结合,可以帮助城市管理者更好的规划交通和优化城市布局。结论,结构化 数据和非结构化数据在各自擅长的领域发挥着重要作用。随着技术的不断进步和数据量的持续增长,如何高效的处理和分析证两类数据成为了新的挑战。 未来,我们期待看到更多创新的技术和解决方案出现,以更好的挖掘数据的价值并服务于社会的发展。

沃尼玛,现在的 ai 行业,结构化数据早就被挖干了,未来的金矿在于非结构化数据治理。什么意思啊?就是企业里那些乱七八糟的 pdf、 合同扫描件、聊天记录、会议录音。谁能把这些垃圾变成大模型?能吃的 r a、 g 数据谁就是大爷。普 通的 e t r 工程师已经没戏了,企业要的是能用 o c r a a s r 配合大模型做复杂清洗的人。你得学会怎么处理表格里的合并单元格, 怎么识别扫描件里的印章啊。这活很脏,但技术含量极高。别嫌脏,越脏的地方护城河越深,去钻研飞镖,数据处理比你学一百个新模型都管用。 我们内部整编的四百级 ai 从零到进阶实战教程,含盖了技术理论、实操代码落地案例,现在开放共享,只要是粉丝,来三个一就行。唯一的要求就是动起来,好好学,别存着不动当收藏家。

在企业 ai 应用中,数据是驱动智能决策的核心燃料。关键数据类型包括结构化数据,如数据库中的客户信息便于机器直接处理。非结构化数据如邮件、社交媒体。文本蕴涵丰富,用户洞察持续数据,记录随时间变化的信息,用于预测、分析 及原数据描述数据的数据,增强数据理解与管理。这些数据类型共同构建起企业爱的基石,通过高效整合与分析,助力企业精准营销、优化运营,提升决策效率,推动数字化转型迈向新高度。

结构化数据的作用是什么?我经常说我开发的独立账模板内置了谷歌结构化数据,那么什么是结构化数据啊?今天我们来学习第十五小节结构化数据标记。 结构化数据是用来提供网页的更多细节信息,把页面内容进行分类的标准化数据格式,这个标准是由必应、谷歌、雅虎共同起早发布的。 添加结构化数据啊,可以帮助搜索引擎准确理解网页的内容,增加相关性,也有助于页面以更丰富的形式显示在搜索结果上,以此提高点击率。简单说,结构化数据呢,它不是给用户看的,而是给搜索引擎看的。 比如很多客户在咨询啊,谷歌搜索关键词的时候,如何在左侧有一张图片,这个就是通过我们结构化数据告诉谷歌我们的封面图片是什么,然后谷歌就会抓取并有一定的概率展示出来。 为什么说有一定概率呢?是因为结构化数据啊,只是我们告诉谷歌我们希望展示的内容,谷歌的抓取和展示是不受我们控制的,最终的展示啊,是以谷歌页面为准。结构化数据呢,它主要是帮助搜索引擎提取网站信息, 所以作者建议呢,做英文的网站一定要添加结构化数据,从而降低搜索引擎理解我们网站内容的难度,也更加有利于搜索引擎的抓取和收入。这一节就为大家继续学习 i c u 是 让密码这本书记得关注收藏,我们下期见,谢谢!

如何让 ai 从看到数据到理解知识,在数字化企业的这个框架下呢?很多知识是被散落在啊不同的角落,所以说我们该怎么去把它有结构化的组装起来?本题论的目标目的就在于把这些所有的信息 都以刚刚我提到的啊目标属性啊连接贯关系和动作,把它整合到一个知识图里面去。我们提供一样这样一个就是本质一样的一个数据分析工具, 那么他的数据,他每一天运行的一些事件和状态都会源源不断的补充在这个啊这个这个平台里面, 这样的话就相当于我们构建了一个就是工厂运行的一个数字化的状态指尖序略,如果你只看那个数字的话,它是一个非常抽象的一个东西,人气其实是看不懂这个数字的跳动, 如果你把它格式化出来,我可以知道每一次如果我操作发我进行了什么操作,我可以看到后面的一些变化,甚至就是说有些原有些异常事件,我可以回溯到是因为哪次是什么操作事件导致了这些东西, 这样一个很直观的展示给用户,那么用户可以很快的发现啊整个工厂的状况以及问题。如果我要进行一个异常诊断的话,我可以参考过去用户的一些记录,给他一个建议, 我们的数据能够这样有结构化的,格式化的展示给用户,他会越用越好。

基于深度学习与知识图谱的设备维护系统 k g p h m agent 基于知识图谱与大模型的设备智能维护系统,是将知识图谱的结构化知识表示与 推理能力和大模型的非结构化数据理解、生成式智能相结合,面向设备全生命周期设计、运行、维护退役的智能化维护解决方案,其核心目标是通过技术系统实现设备故障的精准诊断、提前预测、高效修复、降低停机风险与维护成 本。基于深度学习与知识图谱集成的设备维护系统 k g p h m agent 融合了深度学习、 知识图谱构建、自然语言处理、深度学习大模型信号处理、智能运维等技术,以模块化的方式进行设计与实现。系统采用开放编程语言 支持跨平台应用。通过前后端集成开发,采用开放的模块化、多层架构的设计思想, 能够应用于各种工业设备的故障诊断、故障分析与推理、故障知识管理、智能运维维护决策与监控,满足不同用户在装备健康智能维护与运维管理上的需求,可开展装备的健康知识管理、查询、对话问答、故障诊断、溯源、 推理、运为故障知识库等功能。目前,该系统进入第三阶段的开发。第一阶段, k g p h m a。 诊主要功能模块包括知识图谱构建、故障诊断模块、知识查询与可直观模块、知识图谱与 p h m。 工具箱算法模型集成模块。第二阶段,即将开发智能决策辅助模、数据更新与反馈模块、交互界面设计模块。第三阶段, p h m。 大 模型与知识图谱 集成模块系统架构可分为数据层、知识层、模型层、应用层四个核心层级,各层通过技术接口协调联动。一、数据层,多元易购、数据采集与预处理。二、知识层, 设备领域知识图谱构建知识图谱是系统的知识库,以实体关系属性三元组形式存储设备维护领域的结构化知识,支持精准查询与关联推理。三、模型层,大模型与知识图谱的协调推理。 模型层是系统的智能引擎,通过大模型与知识图谱的协调,实现故障诊断、预测与决策支持。四、应用层,设备智能维护功能落地。基于上述层级,系统可实现以下核心功能, 故障诊断,接收设备报警信号或人工输入的故障现象,如异响加温度高。通过大模型解析与意,结合知识图谱的关联推理定位故障部位与根音。 如故障部位为电机轴承根,因为润滑脂老化绿色性维护。基于传感器实时数据,如震动频 率、温度趋势,结合知识图补充设备寿命、运行参数、关联规则。通过大模型预测故障发生概率与时间。如未来七十二小时内液压系统漏油概率达百分之八十五。提前生成维护计划,维护方案生成, 针对诊断结果自动生成详细维护步骤,含工具、备件安全注意事项,并支持自然语言交互查询。如用户问如何更换密封件,系统返回分布指南、 知识管理与辅助培训。基于知识图谱构建设备维护知识库,支持新员工查询学习。如齿轮箱常见故障有哪些,通过大模型生成案例讲解?如二零二三年同类设备齿轮箱故障案例 处理经验。欢迎装备智能维护、设备故障诊断、制造过程质量控制、人工智能、机器视觉缺陷检测、智能物联系统等智能制造方面的项目,协助系统开发、学术研究等合作。助系统目前不开园,欢迎各位来电来信联系。

你有没有想过这么一个问题,如果一家公司,他最值钱的东西在财报上却一个字都看不见,这会怎么样? 听起来很奇怪吧,但这其实就是过去几十年里,整个数字经济的一个普遍现实。不过啊,现在情况不一样了,一场革命正在中国的资产负债表上悄悄的发生,而他的核心就只有一个词,数据。 来,咱们先来聊聊,你觉得在二十一世纪,一家公司最宝贵的资产会是什么? 嗯,你可能会想到他的专利技术啊,或者是响当当的品牌,甚至是那些顶尖的人才团队。这些答案当然都对,但很可能我们都忽略了那个最核心却又最看不见摸不着的宝藏。 没错,就是数据。你看,这就是我们这个时代最大的一个商业备论。我们天天都说数据是新的,石油是驱动未来的燃料,但你随便翻开一家公司的财报,这份最珍贵的资产却好像人间蒸发了一样,它就像一个藏在所有人眼皮子底下的隐形宝藏。 那么为了让这个隐形宝藏能够正大光明的现身,中国就给出了一个非常明确的官方定义,叫做数据资产。你看啊,不是所有数据都能叫资产的,他必须满足三个关键的条件,第一,这数据得是你合法拥有或者能控制的。 第二呢,他得有潜力在未来给你带来经济上的好处。最后,也是最难的一点,就是,他的价值必须能被可靠的算出来。 哎,那这个从看不见到看得见的过程到底是怎么回事呢?咱们可以把它想象成一个三步走的旅程,你看,一切都开始于最原始乱七八糟的数据记录,然后呢,通过一番清洗和整理,他们就汇集成了有潜在价值的数据资源。 最后一步,最关键要经过法律合规、所有权确认,还有价值评估,它才算真正修炼成功,最终蜕变成可以堂堂正正写进资产负债表的数据资产 好!那么问题来了,是什么力量在这么快地推动这场改革呢?我跟你说,这个答案啊,其实并不是来自企业内部,而是源自中国政府一系列非常果断的顶层设计。 这可不是简单的调整一下会计准则,而是一次经过深思熟虑的国家级战略布局。你看看这个时间线,这个推荐的速度,简直是快得惊人。从二零二年底提出一个基础框架,到二零二四年初就正式落地实行,整个过程连十四个月都不到。 说实在的,这在任何一个国家都是很少见的速度。这充分说明了把数据滋爽化,从一个理论变成现实,决心到底有多大。 这句话可以说是点晴之笔了,他非常精准的概括了这场改革背后的核心驱动力。 什么意思呢?就是说中国已经积累了海量的数据。现在啊,游戏的规则变了,重点不再是谁拥有的数据多,而是谁能更合法、更高效的从数据里头挖出真正的价值。这是一个从量变到质变的根本性转变。 好了,既然政策已经把路都铺平了,那对于一家公司来说,具体应该怎么走完这条通往资产负债表的路呢?别担心,官方已经给出了一份相当详细的路线图, 那这就是官方发布的全流程路线图。我知道我知道,你第一眼看上去肯定觉得特别复杂,甚至有点让人头大。但你先别担心,他的核心逻辑其实可以拆解成几个很关键的阶段。 所以啊,咱们抛开所有那些复杂的流程细节,你只需要记住这三个核心步骤就行了。第一步是在公司内部做好数据治理,说白了就是确保你的数据本身是干净、合规、高质量的。 第二步呢,是向外的登记与合规,就是给你的数据找到一个合法的身份和归属。最后一步才是估值与入账,给数据定个价,然后正式把它写进财报里。 我觉得这张图真正结识了一个核心要点,数据资产化这件事,它从来不是某一个部门的独角戏。 你千万别以为这是 it 部门的技术任务,或者只是财务部门的会计工作。不,它需要从数据、财务业务一直到公司的最高管理层全都参与进来,这本质上就是一个公司级的战略项目,是个一把手工程。 好了,接下来咱们来触及那个最核心也是最困难的问题,数据这东西到底值多少钱?关于这一点,官方的指导意见给出了三种主流的评估方法。 简单来说,这三种方法其实很好理解,成本法就是看我为了拿到这些数据花了多少钱。 收益法呢,是看这些数据未来能帮我赚多少钱。而市场法呢,就是看跟它差不多的数据在市场上能卖多少钱,具体用哪种或者怎么组合着用,就要看这个数据资产的具体特性和应用场景了。 当然了,给数据定价可不是套个公式就完事了这么简单,不管你用哪种方法评勾师都必须考虑这些非常关键的定性因素。你想想,数据的质量越高,那未来的收益潜力肯定就越大,对吧? 应用场景越独特,市场上能找到的可比对象就越少,这些因素都会极大的影响最终的估值。 好说了这么多,费了这么大劲把数据写进财报,究竟能带来什么呢?我跟你说,这绝对不只是一个会计科目发生变化那么简单,它即将释放的是万亿级别的经济潜力。 来记住这个数字,三十万亿人民币,这不是一个小数目,这代表着一个即将被激活的全新的市场的潜在规模。 这里需要强调一下,这三十万亿啊,并不仅仅是指数据本身的买卖,它真正代表的是围绕着数据资产即将爆发的整个服务生态圈。 你想想,从数据评估、合规审计,到数据信托、资产证券化,再到用数据去做抵押贷款,这里面的每一个环节都是一片巨大的蓝海。 那么咱们再说的具体点儿,假如你就是一家公司的 ceo, 这对你来说到底意味着什么呢?首先,你公司的账面价值可能一夜之间就会暴涨。 其次,你手里那些以前沉睡的数据,突然之间就可以像厂房和设备一样拿去银行做抵押贷款了。但我觉得最重要的是,这个过程会反过来逼着你的整个团队去真正思考一个问题,我们到底该如何管理和利用好我们公司最宝贵的资产, 所以你看,我们今天见证的其实是一个根本性的转变。当一家企业最重要却又最无形的资产第一次变得有型、可衡量、可交易的时候,它所开启的将是一个我们今天可能都难以完全想象的创新时代。 这早就不是一个简单的会计问题了,这是一个关乎未来十年企业能不能活下去、活得好不好的核心战略问题。好,今天就聊到这里。

全考场最高分八十五分的话,你们给他打的分数是多少?考生思考完毕,现在开始作答。良好的人际关系是我们正确开展工作的一个重要前提,那对于题目当中出现的这个情况,如果我作为临时负责人,不能合理的与小周进行沟通开展工作,那么势必会影响单位整体工作的进行, 那么所以对于题目当中出现的问题,我作为临时负责人应该完善处理。首先第一点我应该进行一个自我反思,看是否最近工作安排不合理。对于小, 对于小周安排的工作内容过多,或者是没有根据小周的个人特长来进行工作的一个合理安排, 那么在反思过后呢,我会与其他的同事来进行一个交流,看小周是否最近家里有一些特殊情况,无法及时的完成工作。那么在经过一个自我反思以及与同事的一个交流之后,我会和小周来进行一个面对面的交流, 和他进行一个耐心的沟通。首先我会向他说明最近单位领导有事出差,那么我作为临时负责人的安排工作,但是看到小周在工作过程当中可能存在的困难,来询问他具体存在的困难。 那么如果是他确实在生活上存在一些困难,比如说家里有老人或者孩子生病,那么我会想有合理的工作我可以帮助他承担,或者我们单位同事来一起来分工完成这项工作。那么如果是他对于我这个临时负责人安排的工作内容确实是觉得比较多,或者说不 符合他个人的这样一个特长,那么我会跟他进行充分交流之后,将这个工作来根据每个人的特长来进行一个合理的安排,如果内容较多的话,我也会主动帮忙进行一个分担。 那么同时在领导回来之后,我们的这个工作也会梳理之后,向领导来进行一个汇报,确保这个工作的顺利进行。那么通过以上方法,我想我们单位的工作效率会更高,工作的顺利进行,那么通过以上方法,我想我们单位的工作效率 ok。 我 不是很擅长这题, 考生总共用十四分十秒钟哈。思考了一分五十七秒,答了两分十二秒,总共用十四分十秒钟。我先说一下你的形式,形式交流感,流畅度特别好,剩下的时间你就专抓内容了。内容,首先你要干嘛?你要第一点就是我们就要去先学模板, 对吧?学模板非常正确,就是要先学模板,让自己有话说。你这点做到了,下面你要慢慢的去破模板, 但是在破模板的过程当中,你肯定会有所迷茫,你就会想,哎呀,为什么我上了这么多的线,下班回来之后学了个模板,后面我要去破模板,什么也不会,没关系,没关系,你一定要静下心来,慢慢的去破模板。你比方说开头的表态,你用的是什么?你用的是 你?我划横线的这句话你肯定是背的,我不知道你背的是什么,这句话我听过不下十个人说过了,第一句话你是不是背的?嗯?什么?良好的一个人际关系,是我们开展工作的一个什么什么前提还是什么之类的,对吧?是不是背的? 嗯,然后你后面又用了一个一个没有这一句话,哈哈哈。然后你后面刚才说过那个什么独木不成林什么的,人心齐泰山移,对,这个也可以用。然后你后面用了一个影响法, 我在录课程里面也给大家说了这个营销法,但是我在上面还说了一个办法,什么方法?就叫做自我感受法。我们在答人际关系的时候,开头表态要用自我感受法,或者是说直接表出你的原则。 你比方这道题我会这么去说,各位考官,我来谈谈我会如何去处理。面对这种情况呢?作为临时的负责人呢,我的核心原则就是以完成任务为第一要务,同时全力的维护团队的合作。 一句话带过,那么具体来说,下面是重点。那我说过下面具体处理了,具体处理什么时候需要反思?什么时候不用反思。刚才我也给大家讲了, 题目当中有自己严重错误的,我需要去反思,而且反思的时候我不说反思二字,我要跳出自己看自己,立足自身看自身。但是这道题他没有说你自己需要,你自己的问题根本就不是我的错,所以说那我根本就不会反思, 没有我的错,我反思什么?我不会反思是不是我自己安排不合理?是不是我没有按照特长来分工?呸,都不对,我不说。所以说我说什么呢? 我下面就直接交流,但交流你看哈。来,咱们回归现实啊。团队领导出差,小张作为临时的负责人,与小周共同完成工作,小周态度积极,不配合工作。那大家来想想,现实生活中如果领导给咱俩甚至团队给这一整个团队分配了工作, 但是让我来当这个团队负责人,哎,领导出差了,然后你,你不积极,不负责,你消极怠工。为什么?你想想吧,来说一说真实的原因。不服。对,但是我不能直接说这个。怎么不能直接说?就是因为小周不服你啊,为什么你成为这个带头的小组呢?我就不行呢?我消极怠工, 你可以,当然可以,表达出来了,当然可以说了,你看我是怎么说的。对了,人小周也想当负责人,对吧?那你就可以说呀,那首先呢,什么 就是不阳光的把人往坏处想,这样考官会不会觉得我是一个内心不阳光的孩子?那你那你这样就阳光了,那他是不是那个,呃,生活当中有困难呀?分工不合理啊?啊,那个他是不是那个生活上有困难的话,我一定要帮助他。那你这样就阳光了?确实阳光了, 但是我听着一点都不舒服,所以说你看我是怎么说的。首先啊,我会主动的与小周进行一次坦诚的交流,重点不是在于追问, 不要有追问的态度,而是在于倾听和理解。那首先呢,我会先表达对于他的状态的理解以及他能力的认可。各位同学,这一点是什么?是不是在人际关系网课里面我给大家录制过动之以情 沟通的时候,动之以情,晓之以理,然后再去假设问题,给出对策。同学们是不是这样子把动之以情,晓之以理打到公屏上? 好吧,先动之以情,先认可他。那在建立信任基础之上我也会向小周啊客观的分析,当前的任务是关乎我们整个团队的荣誉以及上级对我们的信任,时间紧, 责任重大,任何环节的延迟或者是松懈呢,都有可能影响我们最终的成效,也关系到我们每一个人的专业形象和后续的发展, 我想我们必须得重视起来。这是不是晓之以理了?告诉他这个工作特别紧迫,你不能不干了对吧?动之以情,晓之以理。那完事之后呢, 在沟通的过程之中,我要找到问题所在,假设问题,是不是因为他没有被认命为临时的负责人而感觉到价值受挫,对吧?还是说他对于我这个分工或者是说我的协调方式存在误解,甚至是不认同的? ok, 两点你看我就直接把他假设出来,是不是他不服,我说的是他是不是因为没有被认命为临时的负责人而感到价值受挫 这个点好,那么接下来下面具体问题继续解决好了。那如果是因为小周没有被认定而失落的话,我会在肯定小周的能力基础之上, 赋予他关键的模块的完整主导权,让小周成为这个部分的实际负责人。并且呢,把工作成果作为向领导汇报的重点内容,使小周的这个价值得到充分的展现。 那如果他对于这个分工或者是说协调有疑问的话,我也会跟他共同的复盘工作安排,听取他优化建议。 在确保目标达成的前提之下,我会做到灵活调整分工。同时呢,我也会主动的承担整合协调和最终兜底的责任。定期的向领导汇报进展。为什么定期的向领导汇报进展呀?因为回来可嗨了。 那这,这不是为什么向领导汇报?为什么要定期的向领导汇报工作的进展?同学们,为什么? 我怕出错,干错了之后我不定期汇报一下,全干错了,回来,回来全干错了,领导到最后知道结果了,全是错的。那哪行,是不是定期的向领导汇报这个工作进展,让领导及时知道咱们这个工作做到哪了, 包括方向对不对,对吧。当然在这个时候,关键时刻寻求领导的指导嘛,这个点要说出来,定期的向领导汇报, ok, 好, 做一个新的总结就可以了。各位考官,总结段最后我想说的是,真正优秀的团队从来都不是从不犯错,而是每次都让错误成为进步的阶梯,那么我想只有方法得到,最终呢?一定能够实现。 我们这个是,嗯,工作成功和人,嗯,我积极的配合这样的双重目标。那么以上就是我对这道题的处理办法做的完毕。