视觉智能开启工业“一拖多、非常多”新时代 | 领邦智能董事长崔忠伟接受VisionChina专访
北京领邦智能装备股份公司
董事长 崔忠伟
人工智能正在重塑工业视觉赛道,大模型驱动的视觉智能体,正在打破传统工业检测“一位一工控”的固有模式。北京领邦智能装备股份公司推出的 VisionAgent 从 2.0 迭代升级到 3.0 版本,在处理速度、多任务承载能力上实现跨越式突破。“一拖多非常多”的集中式边缘部署方案,为工业质检带来全新的解题思路。本次我们对话领邦智能董事长崔忠伟,深度拆解 VisionAgent 3.0 核心技术壁垒、产品差异化优势,结合落地案例,看懂新一代视觉智能体如何降本增效,重构工业视觉检测新格局。
精彩现场马上看
崔总您好,之前也了解了咱们的视觉智能体,现在人工智能发展是非常迅速的,VisionAgent 也从 2.0 升级到 3.0,那它相比上一代有什么全新的突破呢?
Q1
大家都知道我们在 2024 年的 10 月份就发布了智能体,3.0 和 2.0 相比第一个重大的突破是速度。2.0 版本我们的推理速度是 40FPS,那么 3.0 版本已经做到了 240FPS。因为我们智能体最大的优点,就是少样本的跨领域泛化能力,但是我们又不能做得非常慢,这对于我们商业化的价值就是能够一拖多非常多,达到这样一个效果。
刚才您也提到了,一拖多非常多这个概念,那它具体指的是什么呢?
Q2
由于我们智能体做得非常快,所以它能够拖非常多。具体来讲有两个含义:第一个含义呢,就是我沿着生产线可以纵向地拖起,就是说着这个智能体,生产线通常有工业质检、有过程监控、有装配正确性,那它们不同的任务可以送到同一台智能体。第二个含义,是横向同时拖很多工位、很多条产线——一台设备同时承载,这就是「一拖多非常多」。
那么咱们这么一台 VisionAgent 的设备,它是如何同时承载这么多的产线工位和任务的呢?
Q3
第一个原因呢,就是我们自研的视觉大模型,它的特点是少样本跨领域泛化能力,它可以把小目标做到 6 个像素就能很好地识别。第二个原因呢,就是我们所有的算子都是 GPU 原生的,这样的话就可以做得非常快。由于这两个原因,我们可以在产线上拖起完全不同的任务,而且一拖多做的非常多。刚刚给大家介绍了边缘智能体,现在再给大家介绍本地智能体。本地智能体和边缘智能体主要区别在于内嵌了控制器,像这个控制器能连接 16 个相机、31 个光源,还有一些光电触发和运动控制。这一款产品主要是方便设备商进行系统集成。
其实观众比较关心,咱们产品是真正如何应用落地的,您能不能给我们举一个一拖多的实际应用案例?
Q4
在一次性餐盘的检测过程中,我们实现了一拖多非常多。我们的智能体它拖了 16 条产线,每个生产线上有 5 个相机。这样的话智能体一共拖 80 个 4K 的相机,那个相机的信号是通过这个网线来进到这个智能体里面的。那么智能体根据这个 80 个相机来的信号,它会做出一个判断,就是 NG 品和 OK 品。那么这个结果呢,反馈到我们现场的 PLC 控制器里面。客户的产品通过机械手放在我们一个传送带上,经过传送带运动通过 5 个相机,把信号采集到智能体,智能体再把信号回到 PLC,PLC 再指挥机械手分选。智能体的吞吐率在 200+ 以上,这个生产的节拍,是 20 秒一个矩阵,那就不说 20 秒要有 5 个相机的图像送进智能体,那根据相机来的图片的尺寸和这个总的吞吐量做一个除法,得到的结论就是一拖 16 条生产线,一拖 80 个 4K 的相机,那就很好地诠释了我们智能体是边缘部署一拖多非常多,创造性价比这么一个概念。
传统的视觉方案是一个工位配一个工控机,那么 VisionAgent 这种集中部署的方式它的优势是什么呢?
Q5
一个工控机配一个工位就可能存在着算力不足,或者是算力过剩,资源的充分利用是很难的。那如果我们一拖多非常多边缘部署的话呢,我们就可以把算力充分地利用起来。它是基于我们大模型和智能体通用性、易用性和快速交付这些特点,决定了我们一拖多非常多这种方式。充分利用资源,性价比非常好,是由于这种原因。