这个项目用 media pipe 实现毫秒级人体感知手势表情姿态,端到端延迟不到一百毫秒。技术上,它用异步式件驱动架构推理线成,不阻色主循环,允许丢帧来保证实时性。手势能识别十几种,剪刀手握拳笔芯大拇指。 表情有三十多个参数,还能判断情绪,身体姿态能算出肩膀角度,躯干倾斜,姿态平分。纯本地运行,基于 python 加 open cv, 不 需要 gpu, macbook 就 能跑。代码开源 m i t 协议。
粉丝9.3万获赞42.1万

看这个炫酷的人脸识别技术,是我帮助一个初中学员辅导青少赛的项目,他是基于 media pipe 这个开源技术, 借助了 ai 开发,非常容易就实现了一个人脸识别。那通过人脸网格的技术判断他是否疲劳怎么样呢?我们借助 ai 做过这种摄像头手势采集的卡牌游戏,如果你再结合一些传感器,那创业就太多了。 有了 ai 之前深奥的技术,现在就算普通人、青少年也都能信手拈来,所以朋友们,创意和动手执行力才是关键。评论区让我看看你的视觉创意,哈哈哈。

这是一个基于 a 二的实时手语识别应用,打开摄像头即可使用。通过 media pop 手部关键点检测,实时追踪双手二十一个关节点,并在画面中叠加彩色粒子特效,实现沉浸式的手语识别与反馈。后续主要是扩展更多 a、 r、 c l 字母和中国手语, 支持带轨迹的动态手势识别。项目已经开源,可在官网获取,你也可以下载使用。 d c l 一 键导入已经打包的版本,直接预览使用。

media pipe 是一款由 google 开发并开源的数据流处理机器学习应用开发框架。 media pipe 是跨平台的,可以运行在嵌入式平台、移动设备、 ios, bandrobe 工作站和服务器上,并支持移动端 gpu 加速。 下面这些都是 google 里有米迪尔派框架实现的移动端应用势力。人脸检测,这是一种超快的人脸检测解决方案, 具有六个地标和多面孔支持。这是一种为移动 gpu 推力量身定制的轻量级且性能良好的人脸检测器。该检测器的超实时性能使其能够应用于任何实时取景器体验面部网格, 这是一种即使在移动设备上也能实时估计四百六十八个三 d 面部特征的解决方案。它采用机器学习来推断三 d 面部表面 只需要一个摄像头输入,而无需专用的深度传感器。该解决方案在整个管道中利用轻量级模型架构和 gpu 加速,提供对现场体验至关重要的实时性能。 此外,该解决方案与面部变化模块捆绑在一起,弥合了面部特征估计和有用的实时,增强现实应用程序之间的差距。该分析在 cpu 上运行,并且在机器学习模型推理之上具有最小的速度内存占用。


这个开源项目是基于头部追踪的实时三 d 演示,通过摄像头创建逼真的虚拟世界窗口效果,通过 media pop 检测红膜标记点以估算三 d 空间中的头部位置,实时调整模型位置,缩放 旋转光照和特效模型。下载方式和使用方式已经放到开源项目中,欢迎体验。


谷歌开源旗舰模型来了,折磨四出道季网红,我谈三点,他不是顶级推理模型,而是在体积受限的情况下,尽量让他聪明一点。第二点,四个尺寸,四个设备都是把一个还不错的脑子直接塞进你的手机电脑等本地设备。第三点, 高度重视智能体,它能一次性看更多更复杂的输入,而且不只限于文字。智能体的现实输入本来就是混乱。开元许可证真香阿帕奇二点零放心商用 jamma 系列这次真正打开局面。

这是使用 media pipe 和优喽混合搭建的脸部实时追踪系统。使用 media pipe 直接在浏览器中追踪面部,并通过 web socket 桥接接收追踪优喽脸部空间数据。优 喽是一个以实时性为核心,以工程化为导向,以多任务统一建模为特征的生产级视觉感知框架。我对它的探索还停留在表面,会持续学习更新。这个演示项目已经开园,欢迎到主页获取。


hello, 大家好,我是瑞德润,今天我们将要学习使用 mediapeap 构建网页 app 应用。嗯,可以看到我们桌面上有七个使用 mediapeap 构建的应用,它们分别是, 第一个库是 object 窗,这个库呢用于识别物体并构建一个三 d 的 一个场景。第二个库呢是 selfie segmenting, 这个库呢用于人物背景的一个抠图的效果。可以看到这个人啊,他是虚拟的,背景是个假的,他人是抠出来的,但是背景可以替换 啊。第三个库呢是 holistic, 这个是获取我们全身的一个位置姿态的一个识别啊。第四个呢是我们的 pose, 这个 pose 呢就识别我们的一些姿势,它和它们这俩其实差不多。 第五个呢就是我们的手势识别,这个在前面的视频里面我玩了很多,这个挺好玩的啊。接着是第六个 face mask, 这个呢是把人的表情的动作全部识别出来了啊。最后一个呢就是 face detection, 这个呢是检测人脸的 啊,可以看到这个图里面有三个人脸,他都可以检测出来。嗯,可以看到官方提供的这个模型数量还是挺多的,但是呢,对于我们使用 java script 源来说的话,他支持的数量比较少,他只支持这么七个,所以我们的目标呢,就放在这七个模型 啊,如果你使用其他的语言的话,你可以去看一下其他的模型的一个调用。好,现在我们来看一下我们这七个模型实现的具体的一个效果展示吧。首先是第一个是我们的物体识别, 这个是我们的 object 床模型,它现在识别的是一个杯子的一个效果啊,识别出来,并且建立了一个三 d 场景,现在是识别的椅子啊,当然它还可以识别鞋子,可以看到每一个鞋子呢,它就标记出来了 啊。最后一个呢就是识别我们的一个摄像机,它能够把这个摄像机的位置识别出来,并且框一下这个位置。 好,接下来呢是第二个模型, self segmentation, 这个模型呢,可以看到,目前呢,他是把我的人物给抠出来了啊,我们要这个效果呢,可以把背景图给替换一下啊,这就是这个模型的一个效果 啊。接着呢是 holistic, 这个模型呢是把我们的人物的面部,还有我们人物的一个姿态的各个骨骼都给识别出来了啊,大家可以做一些交互类的一个效果的话,可以使用这个模型。 接着呢是 pose, 这个 pose 呢就是识别我们身体的各个姿态,可以看到他把我们的关节都识别出来了,但是这个模型呢,没有像比如说我们的手的吧,他识别的没有那么全,他只有一些小的一个姿态。 接下来是我们的汉式,汉式呢,这个库呢就比较常见了,他可以识别我们的手势, 这下一个呢是 face mesh 和 face detection。 左边的是 face mesh, 可以 看到它把我们嘴,嘴巴还有眼睛,甚至我们眨眼睛,它都可以识别出来,这就是 face mesh, 我 们做的什么面部的各种表情的动作呢,它都可以识别出来。 而右边的 face detection 呢,他就是纯粹的检测人脸了,只要有几个人他都能够检测到。好,这就是我们要学习的七个模型。 好,下一集呢,我们将会手把手的带着大家把这些 demo 都敲出来,当然这些 demo 都比较简单,每一个 demo 的 代码呢,都不超过二百行, 那当然其中也会有很多的坑啊,这每个坑呢,都是我一步一步的踩过来的。 ok, 下集见。