专访|从看见到理解,光鉴科技把感知做成了“基础设施”

具身研习社 2026-08-05 10:00
专访|从看见到理解,光鉴科技把感知做成了“基础设施”图1

作者:吕鑫燚

出品:具身研习社


从第一性原理看具身智能产业,你会发现一个很少有人停下来问的问题,物理世界里,智能的起点到底是什么


数字AI时代,这个问题的答案很简单,互联网已经为大语言模型准备好了所有输入,文本、图像、视频,所有数据都已经以数字形式存在,模型只需要处理这些现成的信息。但物理AI时代,游戏规则彻底变了,机器人对物理世界的所有认知、决策、行动,都要从零开始建立,这也是困住具身智能发展的“数据荒”来源。


而连接数字大脑和物理世界的起点接口,就是感知


这不是一个流程上的“第一个环节”,而是所有具身智能的能力边界,你给机器人输入一个什么样的世界,它才能理解一个什么样的世界,最终才能改造一个什么样的世界。过去一年我们总在讨论具身智能的“ChatGPT时刻”何时到来,却忽略了一个最基本的事实,在让机器变聪明之前,我们首先要让机器“看见”真实的世界。光鉴科技创始人兼CEO朱力对具身研习社表示,感知一旦有缺失或者出错,再智能的模型也没有办法修正和实现正确的任务。


这也是为什么我们看到越来越多走出实验室的机器人,在真实场景里偶尔会“失灵”,不是大脑不够聪明,是从感知输入的那一刻起,它看到的世界就是残缺的、错误的。


由此可见,感知不是上游配件,而是它定义了智能的物理边界,是数字大脑进入物理世界的第一个入口,更是决定整个行业落地速度的底层基础设施。


但今天产业内对于感知的价值普遍错配解读,明明在生物识别、自动驾驶上表现足够成熟,但平移到具身智能上却经常出现翻车,这是不是代表感知能力已经到达上限?朱力对这种现状做了一步解释,生物识别的感知力只需要对近距离空间有精准理解;自动驾驶的视觉解决的是“远距离避障”问题,不需要和物体发生深度交互。但具身智能需要的是导航、避障、抓取、操作、和人协作。这便要求具身智能的语境下感知的前提,必须具有更出色的空间感知能力。


为此光鉴科技发布了Libra系列AI双目视觉方案并不是把之前成熟的机器人方案进行小修小改,而是根据具身智能真实的需求与痛点,重新设计了一套解决方案,AI模型引入双目视觉、打造全域泛化感知设计和高效计算架构,构建覆盖具身智能不同应用场景的视觉能力。探索更前沿的感知技术时,又将其变成可量产、可交付、成本可控的产品。

 

专访|从看见到理解,光鉴科技把感知做成了“基础设施”图2

真正的感知基础设施,应该像移动互联网时代的芯片和操作系统一样,通过产品化思维,解决整机厂、模型厂普遍面临的感知侧软硬件问题,让上层的应用开发者不用再关心底层的硬件细节,只需要聚焦在自己的核心能力上。


这也是为什么我们说,感知不是一个可选的硬件配件,而是物理AI时代必须先建好的“高速公路”。


路没修好,再好的车也跑不起来。


专访|从看见到理解,光鉴科技把感知做成了“基础设施”图3

正如具身智能需要专为物理世界设计的大脑一样,感知系统也需要一次更懂物理世界的升级。


在实验室的理想环境中,具身智能可以完成绝大多数演示级任务;但一旦进入真实的物理场景就会面临诸多“盲区”。


首当其冲的是“认知”能力的普遍失效。真实物理世界充满非结构化的复杂工况,透明玻璃、高反光金属、弱纹理墙面、低反射深色物体,这些人类视觉中无需刻意分辨的日常元素,却是当前感知能力的共性盲区。


这些并非工业级的极端工况,也不是罕见的特殊场景,而是家庭、商场、产线中无处不在的日常元素,例如,一扇玻璃隔断、一把金属器具、一面白墙。难以攻克这些环境,直接意味着具身智能会在真实环境中频繁出现避障失误、抓取落空、定位漂移,规模化落地的可用性便无从谈起。


面对这一行业共性难题,光鉴科技选择从底层重构技术路径:将AI 算法原生融入双目视觉体系,而非在传统双目架构上做补丁式叠加,从根本上改写了三维视觉感知的技术范式。


Libra 系列最核心的设计,是在相机里内嵌了一个基于深度学习的空间感知模型。这是AI双目和传统双目最本质的区别。传统双目是“先匹配、再得到深度”,而AI双目的逻辑是“先理解场景、再做深度计算”。算法拿到画面之后,第一步不是找像素匹配,而是先识别场景结构和物体材质,并针对不同的材质调用不同的感知策略。比如面对透明玻璃,传统算法会因为玻璃没有纹理、大部分光都透过去了,直接判定那里没有物体;但AI模型通过参数调整、几何先验等技术的优化,能让模型精准识别玻璃门、玻璃杯等透明物体。


专访|从看见到理解,光鉴科技把感知做成了“基础设施”图4

Libra 1000针对不同材质的点云效果演示

 

专访|从看见到理解,光鉴科技把感知做成了“基础设施”图5

Libra 3000针对透明复杂场景的效果图演示


这种逻辑其实和人眼的感知方式高度一致,我们看到玻璃不会觉得那里是空的,会通过反光、边缘判断物体的存在,AI双目第一次让机器拥有了类似的感知能力。


这个“认识材质”的能力从哪里来?答案是数据。光鉴针对透明、高反、黑色、弱纹理等难点场景采集了大量真实数据,同时在仿真环境中生成仿真数据,两者融合,训练出一个对空间有理解能力的模型。


如此一来,算法从数据里学习不同场景、不同材质下的匹配规律。这种方式直接把双目感知的精度边界推到了新的高度。在高噪声、弱信号的情况下准确匹配像素,还原出完整、连续的深度信息,不会再出现大片空洞,实现毫米级的稳定深度输出,完全满足机械臂、灵巧手精细操作的要求。


过去机器人撞玻璃门、抓不住玻璃杯、看不见小零件的问题,第一次在量产级的相机上得到了解决。


光鉴科技没有把上述能力摊成一张参数表,而是收敛成两个产品。


Libra 1000 采用 2cm 基线,定位于腕部操作感知:装在机械臂末端或灵巧手附近,负责近距离精细操作,机械臂抓取、灵巧手操作、遥操作、数据采集。它可选配双目鱼眼镜头,实现超 180°的水平视场,这个规格远超目前业界产品的普遍水平,满足了抓取类操作需要”余光”精准痛点


专访|从看见到理解,光鉴科技把感知做成了“基础设施”图6


Libra 3000 采用 7cm 基线,定位于头部空间感知:中远距离避障、SLAM 定位、空间建图,输出高质量点云,支撑自主移动与环境理解。它可内部集成空间感知算法,在硬件基础上融合空间理解能力,实现视觉采集、深度计算与空间感知一体化。

 

专访|从看见到理解,光鉴科技把感知做成了“基础设施”图7

这两个产品已经包括了人形机器人最重要的两类需求。头部对应locomotion,机器人在空间中的运动靠头眼协同完成;腕部对应 manipulation,夹爪或手对目标物体的操作。一个管“走到哪”,一个管”抓什么”。


两款模组均支持GMSL 高速输出,硬件接口标准化。 “从一个客户的平台对接到调通,花个几天到一周就能完成”。目前 Libra 已在人形机器人、工业机械臂、垂类服务机器人等主要场景有标杆客户小批量使用;芯片适配上,英伟达主流平台之外,瑞芯微、爱芯元智等国产芯片平台也已完成适配。


对整个具身智能产业而言,Libra 系列的价值远不止是一款性能更强的深度相机。它最直观的价值,是补上了真实物理世界的感知盲区:机器人不会再因看不见透明玻璃而发生碰撞,不会因弱纹理墙面丢失深度信息,不会因高反、深色物体出现感知空洞,这些曾经反复拖慢落地进度的基础难题,第一次有了成熟的量产级解法。


更具产业分量的是,它重新定义了感知系统在产业链中的角色:从被动响应参数要求的硬件配件,进化为自带场景认知能力的原生感知器官。


专访|从看见到理解,光鉴科技把感知做成了“基础设施”图8

技术的突破带来的是更前沿的可能性,而产品化才是可行性。


在做产品定义时,光鉴科技和下游客户讨论的不是“你要买什么样的传感器”,而是“你要解决一个什么样的感知问题”。


比如抓取,拆解开来是定位目标的位置、朝向、不同角度遮挡等一连串功能需求。他给了自动驾驶行业的一个类比,有人做激光雷达,有人做自动驾驶方案,各自拆得很细。而在具身智能行业里,光鉴科技将这两者融合起来,把传感器和空间感知能力融合成一套方案,所有与“看见”有关的问题,都在光鉴科技的半径之内。


用朱力的话来讲,就是帮客户分清感知的边界,让客户聚焦在他们的“大脑”环节。


从场景导向来说,具身智能面对的是复杂多变的物理世界,除了要“看得清”之外,模型还要承担“看清了后怎么做”的环节。因此,具身智能端侧有限的计算资源需要同时支撑感知、定位、规划和推理多个环节。大脑越聪明,留给感知的算力预算越紧张,感知每省下一分算力,都是留给模型推理的资源“花小钱办大事”的方式,也是具身智能企业当下在感知层面组想实现的效果


由此可见,光鉴科技在产品化时,永远多想了一步,其解决方案并不是“你要我解决什么”,而是“我还能做什么”。


在这条产品化脉络下,光鉴科技的第一个答案是省算力具身智能不太可能把很多任务抛到云端来算,所以必须在一个非常有限的算力和结构尺寸下,把这个任务完成。”朱力说。云端方案在延时、可靠性和成本上都过不了本体这一关,感知计算必须发生在相机附近、机器人身上,这进一步压缩了可用的资源空间。朱力特别提到一个产业背景:这两年内存和存储价格高,算力成本居高不下,“如果能够在算力上做很多的优化,是能够节省很多的成本”。端侧算力优化在这个时间点,价值被放大了。


光鉴科技的做法,是把光学设计和算法做协同融合,通过模型压缩和与感知系统平衡“把几百、上千 TOPS 的算法,压到一个算力只几十分之一的算法里面”。这意味着更多算力可以留给 VLA 推理、SLAM 定位这些真正决定机器人智能水平的核心任务。


可以拿一个参照系来看这件事的难度。美国某头部公司的产品效果在业内比较不错,但它的方案需要外配一个1000 美金左右的算力盒。“一个相机如果算力就配 1000 美金,那你如果装了三个,那就是 3000 美金的成本在算力上,这个根本没有办法实际应用”朱力说。以真实数据来看,光鉴科技方案整体的效果优于该公司,同时把计算的成本压了至少好几十倍。在具身智能的语境中,这就是能不能落地的差距。


除了节省感知占用的算力,能提升具身智能落地时的高效率外,光鉴科技还给出了另一个提高效率的方法,从“硬件堆料”到“统一感知底座”的架构升级。


传统机器人感知的思路是“缺什么加什么”,一堆传感器堆在一起,不仅BOM成本高、体积大、功耗高,还会带来数据不同步、坐标系不统一、延迟高、“不同传感器结果不一样该信谁”的协同难题。


而光鉴科技的AI双目视觉,从设计之初就瞄准了具身场景的泛化需求,一套统一的硬件,同时输出毫米级深度图、高清RGB图、稠密点云,原生支持SLAM建图、自主避障、目标检测、精细操作所有视觉任务,不需要再额外堆其他传感器。


所有数据来自同一套光学系统,天然实现亚毫秒级同步,没有坐标系对齐的问题,延迟比多传感器方案低一个数量级。同时算法支持OTA持续升级,随着数据积累,感知能力会越来越强,不用更换硬件就能解锁新的能力。


对整机厂而言,这不止是少装几个传感器的成本节省,更是感知系统从“拼凑式” 到 “一体化” 的架构升级。同源数据保证了信息一致性,端侧闭环大幅降低时延,统一接口缩短了开发周期。研发团队可以从繁琐的感知集成工作中解放出来,把精力投入到模型、运控这些核心竞争力上。


能做到这一点,靠的不是某一个单点技术,而是软硬协同的底层结构。朱力认为这是把感知做好的必要条件:传感器往什么方向优化,需要算法来驱动;而算法要把整个系统设计得更稳定、更有效,又需要光学能力来支持。这是一条完整链路,必须一起来做协同设计,才能得到最优解。


这个链路的底座,是自研的纳米光学芯片为光学硬件提供更强的感知能力和效果,往上是感知算法栈,把底层3D 空间感知与 SLAM、识别分割等应用层算法和光学融合;再往上是端侧计算优化,在极其有限的算力和结构尺寸里完成任务。三层能力互相咬合,感知这个最基础也最硬的骨头被啃下。 

专访|从看见到理解,光鉴科技把感知做成了“基础设施”图9

从这两个维度来看,光鉴科技不只是在做一个技术更强的产品,而是用“多想一步”的思维,做一个真正能落地的产品。这种思维方式区别了常见上游“供应商”的思考逻辑,而是“基础设施”的落地脚印。


当感知不再是卡脖子的短板,整机厂商便不必再将大量研发资源消耗在底层感知的重复造轮上,转而可以聚焦于模型迭代、运控优化与场景落地。这正是产业基础设施的核心价值,它悄悄拉高了整个行业的落地下限,让所有玩家都能站在更坚实的起点上,向更复杂的真实物理场景加速推进。


专访|从看见到理解,光鉴科技把感知做成了“基础设施”图10

2018 年到现在,八年多的时间里,光鉴在家用、水下、商业、工业等各种各样的垂类机器人场景里交付过产品,积累了大量工程化经验。这些过往履历核心是一件事,怎么样把系统做稳定,让相机换了光照、换了场景、换了环境,依然有非常稳定的效果。稳定性无法被设计出来,只能被交付出来。


但过往的履历只是光鉴科技叩开具身智能大门的船票,却远不是航程的终点。


针对具身智能行业发展极快、技术路线尚未确定收敛等特点,光鉴科技也转换了产品化思路。通过OTA 持续升级,让同一套硬件可以随着算法迭代不断解锁新能力,使得客户买的不止是当下的能力,还有未来的空间。


OTA 解决的是单款产品的纵向成长,矩阵化布局则覆盖了全场景的横向需求。光鉴科技搭建了矩阵化产品。这种布局的背后,是对行业发展规律的判断。具身智能至今没有形成统一的形态标准,人形、机械臂、服务机器人各有路径,对感知的基线、视场、精度要求差异极大,此外VLA、世界模型等技术路线持续迭代,每种路线对感知能力等要求差异极大。单品研发模式下,难以匹配客户需求节奏永远滞后于行业变化。而矩阵架构,可以跟上整机厂商的迭代速度。


很多人说视觉感知已经很成熟了,那是因为过去的场景还没有触碰到感知的边界。” 朱力判断,随着具身智能向真实物理场景深入,感知的技术迭代才刚刚进入加速期。


在朱力看来,感知与模型从来不是“感知成熟等待模型调用” 的单向关系,而是互相拉动的螺旋上升。一年多以前,行业的注意力还集中在机器人能否稳定行走、完成简单演示,那时对视觉的要求仅停留在 “能识别大致位置、不撞到障碍物”。而当 VLA 模型、世界模型快速落地,机器人开始承担复杂的操作任务,对感知的精度、稳定性、场景泛化能力的要求立刻被拉高了一个量级。模型越聪明,对输入信息的质量就越挑剔;反过来,感知精度每提升一毫米,模型训练的数据质量就上一个台阶,最终执行任务的成功率也会随之显著提升。


据具身研习社了解,光鉴科技将推出数据采集产品。将现有感知能力整合成更适配数据采集场景的方案,让数据采集设备从可用变为好用。当采集端和本体端使用同一套底层技术时,数据从采集设备迁移到本体训练模型,也会天然更适配。


当行业的聚光灯更多投向大模型、世界模型这些“大脑”环节,感知常常被默认为已经成熟的解决方案,似乎没有太多想象空间。但光鉴科技的路径恰恰说明,当AI 真正走向物理世界,感知恰恰是最有纵深的赛道之一。


从卖硬件到提供完整感知方案,从一锤子交付到持续进化,从本体感知到数据采集闭环,感知的边界正在被不断拓宽。它不再是产业链的一个零部件,而是拉动整个具身智能产业迭代的底层基础设施。


八年工程沉淀是入场的底气,却远不是故事的全部。物理AI 时代的视觉感知想象,才刚刚拉开序幕。




加入社群&找我们玩👇👇👇

专访|从看见到理解,光鉴科技把感知做成了“基础设施”图11
专访|从看见到理解,光鉴科技把感知做成了“基础设施”图12


关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
PCIM研讨会 | 墙报交流:深耕功率器件封装与可靠性技术,解锁车载驱动、高压变频、高密度功率集成前沿创新
各大功率器件名企亮相2026(秋季)亚洲充电展
AI电力竞赛下半场,功率半导体或成最大赢家
PCIM视角 | 三菱电机、富士电机、日立能源推进高压功率模块,储能与电网侧进入系统协同阶段
全球功率半导体20强,中国5家上榜
远期增量市场——航天应用场景中的功率半导体
电动垂直起降飞机(eVTOL)中的功率半导体
中国功率芯片厂商提价,AI服务器面临困境
PCIM 研讨会 | 口述演讲:筑牢器件底层壁垒,精进功率半导体封装与可靠性技术
成功率98%!小米机器人工厂实训进阶
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号