新闻

从成像到感知:锐思智芯在ECCV2026分享HVS 融合视觉下一代多模态视觉范式

当图像(Frame)与事件( Event) 在同一颗传感器中原生融合,计算机视觉会打开怎样的新篇章?

2026年9月8日,锐思智芯(AlpsenTek)受邀参与在瑞典马尔默第19届欧洲计算机视觉会议(ECCV2026)首日举办的Event-Based Multimodal Vision: Imaging, Perception, and Understanding Workshop(基于事件感知的多模态视觉:成像、感知和理解研讨会)。研讨会上,锐思智芯高级研发总监、算法专家陈岩发表了题为“面向物理AI系统的多模态融合事件视觉感知”的特邀报告,围绕 Hybrid Vision Sensor(HVS,融合视觉感知)技术,系统分享了其架构与特性,以及由这种新型视觉数据结构带来的算法与应用机会。

计算机视觉的输入正在被重新定义

作为全球计算机视觉领域顶级学术三大顶级学术会议,今年的ECCV核心议题毫无意外聚焦世界模型、自动驾驶与具身智能等领。那么,下一代物理AI的视觉系统应该有哪些能力,算法之树应该伸向何方?

过去几十年,计算机视觉(Computer Vision)几乎建立在一个默认前提之上:相机即图像生成(Camera = Frame Generator)。图像传感器按固定帧率曝光和采样,算法再从连续图像中推断运动、深度和轨迹。这一体系非常成熟,但当视觉系统开始进入物理世界——机器人、无人机、智能汽车和具身智能——一个越来越明显的问题浮出水面:真实世界是连续变化的,而传统相机对世界的采样是离散的。

比如,一台30 FPS的传统相机每隔约33 ms才产生一次完整观测。这33 ms内究竟发生了什么?通常传统算法只能通过前后两帧图像去估计。提高帧率固然能缓解问题,但代价同样直接:更高的数据带宽、更多的存储、更高的ISP/NPU算力开销、更高的系统功耗——这些都来自大量未发生任何变化的冗余像素数据。

事件感知提供了另一种思路。事件传感器(EVS)不再周期性地读取整幅图像,而是在像素检测到亮度变化超过阈值时,产生包含空间位置(x,y)、时间(t)及亮度变化极性(p)的信息。它天然具备微秒级响应速度、高时间分辨率、高动态范围以及稀疏数据输出等特性。

问题也随之而来:尽管事件很擅长回答“哪里发生了变化”,却并不擅长回答“那里究竟是什么”。而这正是锐思智芯HVS融合视觉感知技术出现的意义。

HVS:芯片级 事件+图像 双模态原生融合

Hybrid Vision Sensor 融合视觉传感器的核心,并非简单的“CIS + EVS”。如果只是将一颗传统摄像头与一颗事件相机拼一起,系统仍要面对光学基线、视差、空间标定、时间同步以及数据融合等一系列问题。HVS融合传感器则更进一步:它在同一颗芯片的像素阵列中,将图像采样与事件侦测集成于一体。通过像素、电路、读出与数据路径的协同设计,芯片可同时获得三种输出(模态):

1. Image Mode:提供完整空间信息、纹理和灰度/图像数据;

2. Event Mode:提供高时间分辨率的运动与变化信息;

3. Hybrid Mode:同时提供1和2两种视觉信息。

由于图像和事件两种异构信号产生自同一个视觉系统,天然具有更好的时空对应关系(Spatial-Temporal Correspondence),这种双模态感知架构,意味着图像和事件无需作为两颗分立的异构传感器完成复杂的后对齐,一步就实现了“一颗芯片对物理世界同时展开两种互补的观测”,即由图像(Frame)描述场景状态(Scene State),而由事件(Events)描述场景变化(Scene Change)。前者负责提供空间和语义,后者专注于提供时间和运动信息。

HVS:重构智能系统视觉感知方式

谈到事件相机,很容易将其直观理解为一种“超高速相机”。但锐思智芯在报告中强调:HVS的意义不仅在于提供每秒数千乃至上万帧的事件等效帧率(EVS Equiv – Frame Rate),更在于能够改变视觉系统获取信息的方式。

传统视觉系统的工作逻辑是:先采集所有数据,再通过计算找出重要信息。即:1、拍摄记录所有细节→2、计算所有细节→3、计算找出关键变化;

事件感知的工作逻辑则更接近:1、部分信息发生变化→2、传感器(只针对变化)响应。

在真实世界中,变化本身往往就意味着最关键的特征信息。因此,传感器可以在数据产生的最早期直接完成时间数据蒸馏(Temporal Data Distillation)。只要非运动区域或背景不发生变化,传感器就不需要重复静态信息的读出与计算。对事件感知而言,帧率提升只是其中一项显著变化,而整个视觉感知链路也将伴随更低的延迟、更高的时间分辨率、更少的冗余数据、更高的动态范围,以及更低的系统功耗和计算开销。对于以追求实时闭环为核心的机器人、汽车和 Physical AI,这些视觉特性都是系统梦寐以求的。

传感器增加一个模态,算法框架也将随之改变

锐思智芯报告中特别指出:HVS更值得计算机视觉研究者关注的地方在于其提供了一种过去传统帧式相机时代完全不存在的算法输入。图像与事件的结合,并不仅仅是简单的数据混合(Fusion),它允许算法研究者从头重新审视许多经典视觉问题。

一、去运动模糊:不再只凭借模糊图像“猜”运动

传统去模糊本质上是补充或回填数据缺失——物体在曝光窗口内移动,多个时刻的信息被积分进同一张图像带来模糊。而事件擅长持续记录曝光期间的亮度变化和运动轨迹。问题就此变成:如果已获得曝光过程中的真实时间信息,是否仍需要沿着传统框架仅依靠模糊图像去倒推并猜测出运动?

答案显然为否。在HVS框架内,帧提供纹理和绝对强度,事件提供曝光期间的高频运动约束。二者结合,使得很多原本严重ill-posed的算法问题,在增加时域观测框架后得到很好解决或激发更多方向,这也是事件引导的去模糊(Event-guided Deblurring)近年成为计算摄影重要研究方向的原因之一。

二、视频插值:两帧之间,并非空白

传统Video Frame Interpolation需要从两个已知时刻帧([I(t_0), I(t_1)]),推出中间帧([I(t),t_0<t<t_1]),但真正发生在相邻两帧间的运动并未被直接观测到。事件流恰恰提供了这个帧间窗口中的运动信息。HVS通过帧描述关键时刻的完整场景,通过事件描述关键帧之间发生的连续变化。对于慢动作拍摄、高帧率视频重建等任务,这无疑是一种更加自然和聪明的任务分工和数据组合。

三、追踪与光流:从“比较两帧间的变化”到“直接在源头定位变化”

传统光流和目标追踪极大依赖帧到帧对应(Frame-to-Frame Correspondence)。运动越快,两帧间位移越大,匹配就越困难。事件感知则提供了完全不同的时间采样方式:物体因运动而于轮廓处产生大量事件信号,从而标示出真实连续的时空轨迹。在HVS框架中,事件负责感知运动、描述轨迹、提供高频时间先验知识(temporal prior);图像则专注于提供纹理、类别和细节语义。这种分工对高速追踪、视觉里程计、SLAM和无人机视觉尤其宝贵。

四、低功耗常开(Always-on):相机不必全程盯着看

真实世界中,许多端侧AI的真正问题卡在持续工作的系统开销。比如为了等待一个偶发事件,摄像头、ISP和主控芯片必须全天持续响应,功耗将异常可观。事件感知提供了一种新思路:设备平时以超低功耗的事件感知模式运行,当检测到人、运动或特定事件后,迅速唤醒图像功能和主控算法,进行精细判断。目前,锐思智芯的APX004已实现Hybrid/Event/Image模式切换,并已实现方案落地。

五、从被动成像走向主动感知

除了经典算法,HVS还开启了主动视觉的新可能。以结构光为例:传统方案需投射编码光场,再通过相机观察形变恢复出深度。而研究者可以利用事件传感器对光强变化极为敏感的特性,将主动光源进行时域编码(temporal encoding),用传感器直接检测投射光在时间序列上的变化。这意味着传感器能直接在时域内帮助完成编码解调。对于高速3D成像、机器人近场避障及复杂动态环境中的深度信息获取,这打开了一条不同于传统结构光和飞行时间的研究路径。锐思智芯APX014 芯片也已包含了快速避障(Rapid Obstacle Avoidance)、结构光(Structured Light)、目标检测和识别(Target Detection and Recognition)等应用定位。

新品 APX006 即将发布

报告还预告了锐思智芯即将推出的新品APX006。其为AI移动影像而专门设计,在单颗芯片上集成5000万像素APS成像阵列与300万像素事件感知阵列。通过输出标准RGB RAW数据,APX006可无缝嵌入现有ISP与SoC流水线,支持从无鬼影单帧HDR到超低功耗常开感知等一系列新型应用,可为研究者们提供最新的量产级融合视觉传感器和算法栈,将加速该领域的前沿算法探索。

成像到感知:HVS的最大价值来自传感器AI的深度耦合

今天,大量AI Vision创新发生在模型层——更大的主干网络、更复杂的Transformer、更多数据、更强算力,等等。但对于真正进入物理世界的AI,还有另一条值得重新思考的路径:是不是所有的信息,都应该先变成图像或视频后,再交给更强大的AI?

高速摄像头每秒产生上百甚至上千张图像,但现实世界中真正发生变化的区域往往只是其中很小一部分。当传感器能够直接看懂哪里发生了变化,并且同时提供变化时间和运动矢量方向,很多原本需要神经网络从大量图像中提取的信息,已在源头感知阶段就被显式表达。

这正是锐思智芯理解的AI原生视觉传感器(AI-native Sensor)。它不是简单地在视觉传感器后面增加一个AI Processor,而是在信息获取之初就思考“什么形态的数据对于机器真正重要”。

传统图像传感器最重要的任务是“拍好照片”——像素、量子效率、噪声、动态范围、分辨率,这些能力依然重要。但随着机器人、无人机、智能汽车和具身智能的快速发展,视觉传感器的评价维度正起着变化。该领域的元需求,已从“拍好照片”变为“高效响应物理世界世界变化”。

HVS融合视觉感知技术,正是脱胎于这一趋势的新型传感器架构。与早期事件相机方案不同,它并不宣称取代帧-图像视觉体系,也并不仅是用事件相机简单替换传统相机,而是创造性地保留了两种模态的感知方式——以图像描述世界,用事件感知变化,即让二者在其擅长的领域发挥最大作用,并以一种工程上的平衡策略来实现真实场景中的具体应用。

而当图像和事件二者已在同一颗芯片完成融合,当AI正从数字世界加速走向物理世界,一个等待着包括锐思智芯在内的所有人的、更值得探索的问题才刚刚展开:如果传感器自身可以同时感知空间与时间,那么,更适配物理AI设备、汽车和机器人的下一代计算机视觉应该是什么样子?

这也是锐思智芯此次参与ECCV 2026和EBMV研讨会,最希望与全球计算机视觉研究者们持续探讨的问题。

无论是成像到感知的范式转变,还是从事件-图像时空同步采样到多模态融合视觉,视觉领域的下一次关键变化,并不仅仅只会发生在算法与应用层,也将从第一个感知光子的芯片像素开始。

关于ECCV 2026EBMV研讨会

欧洲计算机视觉会议(ECCV)是全球计算机视觉领域顶级学术会议之一,每两年举办一届,与CVPR、ICCV并成为计算机视觉领域三大顶会。本届会议汇集了图灵奖得主Yann LeCun等顶尖学者,世界模型、自动驾驶与具身智能成为核心议题。

同期举行的事件驱动多模态视觉”(Event-Based Multimodal Vision, EBMV)研讨会专注于事件视觉与其他传感模态交叉领域的专题论坛,再度成为神经形态与事件驱动感知领域前沿研究者与工程师的核心交流平台,聚焦从传感系统、底层成像到高层感知与理解的全链条研究,是连接学术创新与产业落地的重要桥梁。

ECCV2026/EBMV Links:

The 19th European Conference on Computer Vision (ECCV) ECCV2026大会官方网站:https://eccv2026.ecva.net/

Workshop on Event-Based Multimodal Vision (EBMV)基于事件的多模态视觉研讨会专题网站: https://eventbasemultimodalvision.github.io/

相关内容

最近搜索

微信搜一搜

AlpsenTek锐思智芯