转自：地平线开发者

智能驾驶感知模块可以根据目标的属性和环境信息，分为三类关键任务：动态感知任务、静态结构感知任务和可通行区域（Freespace）感知任务。

本文将结合 BEVFormer、MapTR 和 Occupancy Prediction 三个算法，简单介绍一下他们，如果有不正确的地方，欢迎评论。

01 动态感知任务：BEVFormer

1.1 任务简介

动态任务关注的是检测和跟踪场景中运动物体，如行人、车辆、自行车等。核心目标是预测这些目标的三维空间位置、尺寸、速度和朝向，为路径规划与决策系统提供实时支持。

1.2 核心算法

BEVFormer 是近年来领先的 3D 感知框架之一，提出了一种融合 Bird’s Eye View（BEV）视角和 Transformer 架构的感知方式。它利用多摄像头输入构建 BEV 表征，并结合时序特征做运动物体感知。

BEV 是什么？

BEV（Bird’s Eye View，俯视图）是一种以“从天而降”的视角查看场景的表示方式。相较于图像原始视角（front-view），BEV 将感知信息映射到地面平面，使得空间关系更直观：

每个像素表示地面上一个固定区域（如 0.5m × 0.5m）；
BEV 具有固定分辨率和尺度，便于与规划、控制模块对接；
动态物体不会因远近发生比例变化，便于稳定检测和跟踪。

BEVFormer 架构简介

图像编码：使用 ResNet+FPN 的 backbone+neck 结构提取多视角图像特征；
Lift 操作：将图像特征结合深度预测“抬升”（lift）到三维空间中；
Splat 投影：将三维点投影到 BEV 平面网格，聚合形成 BEV 特征图；
时序建模：引入前几帧 BEV 特征，使用 temporal attention 模块进行时序对齐；
目标检测解码器：采用 learnable query，预测 3D 物体框及其类别。

Lift（抬升）

在感知任务中，模型经常需要将图像信息“映射”到三维空间中。这一过程称为 Lift（抬升），可以实现实现 2D → 3D 映射，统一多个视角的感知结果。

具体来说：

每个像素在原始图像中只提供 2D 信息（x， y），没有深度；
利用深度估计（或相机投影矩阵）推测该像素在 3D 空间中的位置；
所有 3D 点再“划分”为离散的三维网格（Voxel Grid），以统一尺度处理。

3D 物体框表示形式

BEVFormer 输出的 3D BBox 通常以 [x， y， z， dx， dy， dz， θ] 表示：

（x， y， z）：中心坐标；
（dx， dy， dz）：尺寸；
θ：朝向角。

02 静态建图任务：MapTR

2.1 任务简介

静态感知任务主要关注场景中静态结构物体，包括车道线、道路边界、停止线等。这类信息对地图构建、定位、行为规划等很重要。

2.2 核心算法

MapTR 是一种矢量建图方法，首次在 Transformer 框架中实现了 Polyline 格式的地图元素生成。与传统的栅格输出不同，MapTR 直接输出点序列形式的几何结构，精度更高。

Polyline 是什么？

Polyline 是一条折线，由一系列顺序连接的点组成，常用于表示线型元素：车道线、道路边界、路沿、箭头、停止线等。

通常每条 polyline 表示为点集 [p1， p2， …， pn]，每个点为（x， y）或（x， y， attr）（带语义）。

MapTR 架构简介

图像特征提取：使用 CNN + Transformer 提取多摄像头图像特征；
BEV 表征生成：将图像 lift 到 3D 后，splat 投影为 BEV 特征；（前两步和动态感知任务那儿一样）
结构化 Query 解码：

每个 query 对应一条 polyline；
生成起点后，通过自回归方式生成后续点序列；

多类别建图：支持同时预测多类地图元素，如 divider（车道之间的分隔线）、boundary（道路边界）、arrow（导向箭头）、stopline（停止线）等。

03 Freespace 感知任务：Occupancy Prediction

3.1 任务简介

Freespace 任务旨在预测环境中可通行区域与障碍物位置。通过对周围三维空间进行体素划分，输出每个 voxel（体素）的占用状态。

3.2 核心算法

Occupancy 模型通常采用图像或点云输入，结合深度估计和 3D 重建，生成 Occupancy Grid，即空间占用网格。

什么是 Occupancy Grid？

Occupancy Grid 是将三维空间离散为等间距的体素格（voxel），每个 voxel 包含一个数值表示其被占用的概率：

值为 0：free 空间；
值为 1：确定被障碍物占据；
值介于两者之间：存在不确定性。

典型输出维度为 [B， C， X， Y， Z]，其中 B 为 batch size，C 为类别数或 occupancy 状态数，X、Y、Z 表示 3D 空间上的 voxel 网格。

对这里的 C 再展开聊一下：

C = 1（单通道概率）

表示每个 voxel 的被占概率，即该 voxel 被物体占据的概率；
输出经过 sigmoid 激活函数，将值映射到 0，1；
值越接近 1 → 越确定被物体占据；接近 0 → 自由空间。


# 示例：输出为 [B, 1, X, Y, Z]，经过 sigmoid 得到概率occupancy_logits = model(input)occupancy_probs = torch.sigmoid(occupancy_logits)

C > 1（多通道分类概率）

每个 voxel 是一个多分类问题，比如：

通道 0：free
通道 1：occupied
通道 2：unknown 或 uncertain

输出经过 softmax，每个 voxel 的 3 个类别概率和为 1：


# 示例：输出为 [B, 3, X, Y, Z]，对 C=3 维度做 softmaxoccupancy_logits = model(input)occupancy_probs = torch.softmax(occupancy_logits, dim=1)
# occupied 概率提取occupied_prob = occupancy_probs[:, 1, ...]

也可以引入语义标签，将空间分为：

drivable（可通行区域）；
static obstacle（建筑物、护栏）；
dynamic obstacle（行人、车）；
unknown（不确定区域）。

04 总结

看下图有个感觉即可：

【免责声明】转载出于非商业性的教育和科研目的，只为学术新闻信息的传播，版权归原作者所有，如有侵权请立即与我们联系，我们将及时删除。

☟☟☟

☞人工智能产业链联盟筹备组征集公告☜

☝

精选报告推荐：

11份清华大学的DeepSeek教程，全都给你打包好了，直接领取：

【清华第一版】DeepSeek从入门到精通

【清华第二版】DeepSeek如何赋能职场应用？

【清华第三版】普通人如何抓住DeepSeek红利？

【清华第四版】DeepSeek+DeepResearch让科研像聊天一样简单？

【清华第五版】DeepSeek与AI幻觉

【清华第六版】DeepSeek赋能家庭教育

【清华第七版】文科生零基础AI编程：快速提升想象力和实操能力

【清华第八版】DeepSeek政务场景应用与解决方案

【清华第九版】迈向未来的AI教学实验

【清华第十版】DeepSeek赋能品牌传播与营销

【清华第十一版】2025AI赋能教育：高考志愿填报工具使用指南

10份北京大学的DeepSeek教程

【北京大学第一版】DeepSeek与AIGC应用

【北京大学第二版】DeepSeek提示词工程和落地场景

【北京大学第三版】Deepseek 私有化部署和一体机

【北京大学第四版】DeepSeek原理与落地应用

【北京大学第五版】Deepseek应用场景中需要关注的十个安全问题和防范措施

【北京大学第六版】DeepSeek与新媒体运营

【北京大学第七版】DeepSeek原理与教育场景应用报告

【北京大学第八版】AI工具深度测评与选型指南

【北京大学第九版】AI+Agent与Agentic+AI的原理和应用洞察与未来展望

【北京大学第十版】DeepSeek在教育和学术领域的应用场景与案例(上中下合集)

8份浙江大学的DeepSeek专题系列教程

浙江大学DeepSeek专题系列一--吴飞：DeepSeek-回望AI三大主义与加强通识教育

浙江大学DeepSeek专题系列二--陈文智：Chatting or Acting-DeepSeek的突破边界与浙大先生的未来图景

浙江大学DeepSeek专题系列三--孙凌云：DeepSeek：智能时代的全面到来和人机协作的新常态

浙江大学DeepSeek专题系列四--王则可：DeepSeek模型优势：算力、成本角度解读

浙江大学DeepSeek专题系列五--陈静远：语言解码双生花：人类经验与AI算法的镜像之旅

浙江大学DeepSeek专题系列六--吴超：走向数字社会：从Deepseek到群体智慧

浙江大学DeepSeek专题系列七--朱朝阳：DeepSeek之火，可以燎原

浙江大学DeepSeek专题系列八--陈建海：DeepSeek的本地化部署与AI通识教育之未来

4份51CTO的《DeepSeek入门宝典》

51CTO：《DeepSeek入门宝典》：第1册-技术解析篇

51CTO：《DeepSeek入门宝典》：第2册-开发实战篇

51CTO：《DeepSeek入门宝典》：第3册-行业应用篇

51CTO：《DeepSeek入门宝典》：第4册-个人使用篇

5份厦门大学的DeepSeek教程

【厦门大学第一版】DeepSeek大模型概念、技术与应用实践

【厦门大学第二版】DeepSeek大模型赋能高校教学和科研

【厦门大学第三版】DeepSeek大模型及其企业应用实践

【厦门大学第四版】DeepSeek大模型赋能政府数字化转型

【厦门大学第五版】DeepSeek等大模型工具使用手册-实战篇

10份浙江大学的DeepSeek公开课第二季专题系列教程

【精选报告】浙江大学公开课第二季：《DeepSeek技术溯源及前沿探索》（附PDF下载）

【精选报告】浙江大学公开课第二季：2025从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例（附PDF下载）

【精选报告】浙江大学公开课第二季：智能金融——AI驱动的金融变革（附PDF下载）

【精选报告】浙江大学公开课第二季：人工智能重塑科学与工程研究（附PDF下载）

【精选报告】浙江大学公开课第二季：生成式人工智能赋能智慧司法及相关思考(附PDF下载）

【精选报告】浙江大学公开课第二季：AI大模型如何破局传统医疗（附PDF下载）

【精选报告】浙江大学公开课第二季：2025年大模型：从单词接龙到行业落地报告（附PDF下载）

【精选报告】浙江大学公开课第二季：2025大小模型端云协同赋能人机交互报告（附PDF下载）

【精选报告】浙江大学公开课第二季：DeepSeek时代：让AI更懂中国文化的美与善（附PDF下载）

【精选报告】浙江大学公开课第二季：智能音乐生成：理解·反馈·融合（附PDF下载）

6份浙江大学的DeepSeek公开课第三季专题系列教程

【精选报告】浙江大学公开课第三季：走进海洋人工智能的未来（附PDF下载）

【精选报告】浙江大学公开课第三季：当艺术遇见AI：科艺融合的新探索（附PDF下载）

【精选报告】浙江大学公开课第三季：AI+BME，迈向智慧医疗健康——浙大的探索与实践（附PDF下载）

【精选报告】浙江大学公开课第三季：心理学与人工智能（附PDF下载）

【精选报告】浙江大学公开课第三季：人工智能赋能交通运输系统——关键技术与应用（附PDF下载）

【精选报告】浙江大学公开课第三季：人工智能与道德进步（附PDF下载）

相关阅读

干货推荐：

【AI加油站】第一部：《大型语言模型应用检索增强生成：改变搜索、推荐和 AI 助手》附下载

【AI加油站】第二部：《程序员的自我修炼手册》（附下载）

【AI加油站】第三部：《大规模语言模型：从理论到实践》（附下载）

【AI加油站】第四部：《使用生成式人工智能和Python开始数据分析》（附下载）

【AI加油站】第五部：《使用生成式人工智能和Python开始数据分析》（附下载）

【AI加油站】第六部：《时间序列：建模、计算与推断》（附下载）

【AI加油站】第七部：《因果关系的逻辑理论的好书-A Logical Theory of Causality》（附下载）

【AI加油站】第八部：《模式识别（第四版）-模式识别与机器学习》（附下载）

【AI加油站】第九部：《Python深度学习（中文版）》（附下载）

【AI加油站】第十部：《机器学习方法》（附下载）

【AI加油站】第十一部：《深度学习》（附下载）

【AI加油站】第十二部：《从零开始的机器学习》（附下载）

【AI加油站】第十三部：《Transformer入门到精通》（附下载）

【AI加油站】第十四部：《LLM 应用开发实践笔记》（附下载）

【AI加油站】第十五部：《大模型基础完整版》（附下载）

【AI加油站】第十六部：《从头训练大模型最佳实践》（附下载）

【AI加油站】第十七部：《大语言模型》（附下载）

【AI加油站】第十八部：《深度强化学习》（附下载）

【AI加油站】第十九部：清华大学《大模型技术》（附下载）

【AI加油站】第二十部：Prompt入门神书-《Prompt 学习指南》（附下载）

【AI加油站】第二十一部：吴恩达&open AI联合推出《大模型通关指南》（附下载）

【AI加油站】第二十二部：《李宏毅深度学习教程》值得反复阅读的神书！（附下载）

【AI加油站】第二十三部：Prompt经典中文教程-《提示工程指南》（附下载）

【AI加油站】第二十四部：爆火下载28万次！MIT最新神书《理解深度学习》（附下载）

【AI加油站】第二十五部：LLM4大名著，OpenAI专家强推《深度解析：大语言模型理论与实践》（附下载）

【AI加油站】第二十六部：NLP大牛Thomas Wolf等新书《Transformer自然语言处理》（附下载）

【AI加油站】第二十七部：哈工大博士耗时一年整理《PyTorch常用函数手册》，轻松掌握PyTorch的各种操作（附PDF下载）

【AI加油站】第二十八部：大模型炼丹大师必备《深度学习调优指南中文版-系统性优化模型》（附下载）

【AI加油站】第二十九部：炸裂发布！《大语言模型：导论》重磅发布！（附下载）

【AI加油站】第三十部：最值得读的LLM书！下载量10w+！《基于Transformer和扩散模型的生成式AI》（附下载）

【AI加油站】第三十一部：RL稀缺宝典！《强化学习的艺术》（附下载）

【AI加油站】第三十二部：一本醍醐灌顶的教科书！《大语言模型提示工程：构建LLM应用的艺术与科学》（附下载）

【AI加油站】第三十三部：机器学习好评榜第一《机器学习基础》（附下载）

【AI加油站】第三十四部：所有大模型领域学习者必读，没有之一！由深度学习三巨头联合撰写！（附下载）

【AI加油站】第三十五部：{AI炼丹神书}——从0到1榨干深度学习模型每一滴性能的终极战术手册《深度学习调优指南》（附下载）

【AI加油站】第三十六部：面向生产环境的大型语言模型实战手册《LLM 大语言模型构建指南》（附下载）

【AI加油站】第三十七部：《深度学习的数学导论：方法、实现与理论》从神经网络架构到物理信息模型的全景综述（附下载）

【AI加油站】第三十八部：下载量10w+！《大型语言模型：语言理解和生成》从文本分类到主题建模的实战指南（附下载）

【AI加油站】第三十九部：包教包会！《从零开始构建大语言模型的关键要点》大模型训练全景指南：从0到1的系统性最佳实践（附下载）

【AI加油站】第四十部：《大规模机器学习训练工程实战手册》——从硬件选型到故障恢复的系统性指南（附下载）

【AI加油站】第四十一部：《ChatGPT后训练全景解析：技术演进、核心挑战与未来方向》（附下载）

【AI加油站】第四十二部：《百页机器学习书》：从算法到实战的全景指南（附下载）

【AI加油站】第四十三部：《掌握大语言模型》核心知识速览：从NLP基础到LLM前沿实践（附下载）

【AI加油站】第四十四部：《精通PyTorch》-从CNN到Transformer、LLM、GNN的端到端实战图谱（附下载）

【AI加油站】第四十五部：《图神经网络导论》-全景拆解：从数学基石到落地应用的知识地图（附下载）

【AI加油站】第四十六部：谷歌大佬编写，我唯一熬夜看完的机器学习神作《机器学习：概率视角》（附下载）

【AI加油站】第四十七部：复旦大学张奇老师《自然语言处理导论》（附下载）

【AI加油站】第四十八部：Github持续霸榜！「Leetcode刷题笔记」解题思路/代码/模板开放下载！（附下载）

【AI加油站】第四十九部：下载10W+爆火神书《基于LangChain进行生成式AI开发》（附下载）

AI机器人设计推荐：

【AI加油站】机器人设计系列一：《IBM Robocode人工智能机器人研究》从Java编程到智能战斗系统指南（附下载）

【AI加油站】机器人设计系列二：《PVCBOT零基础机器人制作》从PVC线槽到专属机器人的完整入门指南（附下载）

【AI加油站】机器人设计系列三：《ROBOTC与机器人程序设计》从NXT到TETRIX的完整实战指南（附下载）

【AI加油站】机器人设计系列四：《多关节机器人原理与维修》全本技术精要总结（附下载）

【AI加油站】机器人设计系列五：《工业机器人应用与维护职业认知》——基于“任务驱动”的中职人才培养全景教材解析（附下载）

RPA 流程自动化系列推荐：

【AI加油站】RPA 流程自动化系列一：《机器人流程自动化魔力象限》市场格局、厂商优劣与选型指南（附PDF下载）

【AI加油站】RPA 流程自动化系列二：从RPA到APA：ProAgent引领的智能代理流程自动化革命（附PDF下载）

【AI加油站】RPA 流程自动化系列三：AUTONODE：认知 GUI 自动化的“神经-图式”自学习引擎全景解读（附PDF下载）

【AI加油站】RPA 流程自动化系列四：PromptRPA——面向智能手机的自然语言驱动机器人流程自动化系统综述（附PDF下载）

【AI加油站】RPA 流程自动化系列五：《FlowMind》：金融级智能工作流自动生成框架（附PDF下载）

面试推荐：

【AI加油站】AI面试专题一：BIO,NIO,AIO,Netty面试题（附下载）

【AI加油站】AI面试专题二：Git常用命令面试题（附下载）

【AI加油站】AI面试专题三：Java常用面试题（附下载）

【AI加油站】AI面试专题四：Linux系统的面试题集（附下载）

【AI加油站】AI面试专题五：Memcached 面试题集（附下载）

【AI加油站】AI面试专题六：MyBatis框架的面试题（附下载）

【AI加油站】AI面试专题七：MySQL相关的面试题资料（附下载）

【AI加油站】AI面试专题八：Netty面试题资料（附下载）

【AI加油站】AI面试专题九：Nginx的面试题资料（附下载）

【AI加油站】AI面试专题十：RabbitMQ的面试题资料（附下载）

【AI加油站】AI面试专题十一：Redis的面试题资料（附PDF下载）

【AI加油站】AI面试专题十二：Spring的面试题资料（附PDF下载）

【AI加油站】AI面试专题十三：Apache Tomcat的面试题资料（附PDF下载）

【AI加油站】AI面试专题十四：Zookeeper的面试题资料（附PDF下载）

【AI加油站】AI面试专题十五：《阿里巴巴Java开发手册》终极版的面试题资料（附PDF下载）

【AI加油站】AI面试专题十六：大数据技术面试题资料（附PDF下载）

【AI加油站】AI面试专题十七：Java并发多线程面试题资料（附PDF下载）

【AI加油站】AI面试专题十八：设计模式的面试题资料（附PDF下载）

【AI加油站】AI面试专题十九：Java虚拟机（JVM）的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十：Elasticsearch的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十一：TCP UDP Socket Http网络编程的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十二：消息队列Kafka的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十三：Spring Boot的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十四：Spring Cloud的面试题资料（附PDF下载）

【AI加油站】AI面试专题二十五：Dubbo的面试题资料（附PDF下载）

大模型课程推荐：

【AI加油站】大模型课程系列一：大模型应用：从提示工程到AI智能体——系统化知识地图（附PDF下载）

【AI加油站】大模型课程系列二：大模型应用：从提示工程到AI智能体——系统化知识地图--合集（附PDF下载）

【AI加油站】大模型课程系列三：《大模型应用·第3章：大模型提示词》-大模型提示词设计七步法（附PDF下载）

【AI加油站】大模型课程系列四：《大模型应用·第4章：大模型辅助工作学习》一站式检索-办公-创作全攻略（附PDF下载）

【AI加油站】大模型课程系列五：《大模型应用·第5章：大模型检索增强》读懂大模型检索增强生成（RAG）全景（附PDF下载）

【AI加油站】大模型课程系列六：《大模型应用·第6章：大模型认知框架》从情景模仿到自我进化的7种思维范式（附PDF下载）

【AI加油站】大模型课程系列七：《大模型应用·第7章：大模型使用工具》-从“会聊天”到“能办事”的7个关键洞察（附PDF下载）

【AI加油站】大模型课程系列八：《大模型应用·第8章：AI智能体核心技术》-从单脑到群体协作的工程落地指南（附PDF下载）

【AI加油站】大模型课程系列九：《大模型应用·第9章：AI智能体开发平台》-从理论到落地的母婴助手案例解析（附PDF下载）

【AI加油站】大模型课程系列十：《大模型应用·第10章：AI智能体行业案例》-四大场景深度解析与实战指南（附PDF下载）

人工智能产业链联盟高端社区

精选主题推荐：

Manus学习手册

从零开始了解Manus

DeepSeek 高级使用指南，建议收藏

一次性说清楚DeepSeek，史上最全（建议收藏）

DeepSeek一分钟做一份PPT

用DeepSeek写爆款文章？自媒体人必看指南

【5分钟解锁DeepSeek王炸攻略】顶级AI玩法，解锁办公+创作新境界！

DeepSeek接入个人微信！24小时智能助理，随时召唤！

PS×Deepseek：一句话编写PS脚本，搞定PS批量导出图层

如何让AI给自己打工，10分钟创作一条爆款视频？

荐：

【中国风动漫】《姜子牙》刷屏背后，藏着中国动画100年内幕！

【中国风动漫】除了《哪吒》，这些良心国产动画也应该被更多人知道！

【中国风动漫】《雾山五行》大火，却很少人知道它的前身《岁城璃心》一个拿着十米大刀的男主夭折！

声明

免责声明：部分文章和信息来源于互联网，不代表本订阅号赞同其观点和对其真实性负责。如转载内容涉及版权等问题，请立即与小编联系（微信号：913572853），我们将迅速采取适当的措施。本订阅号原创内容，转载需授权，并注明作者和出处。如需投稿请与小助理联系（微信号：AI480908961）

编辑：Zero