
编辑:陈萍萍的公主@一点人工一点智能

原文地址:https://arxiv.org/pdf/2410.07087
项目地址:https://prince687028.github.io/OpenUAV/
导读:视觉语言导航(Vision-Language Navigation, VLN)作为具身智能领域的重要研究方向,旨在使智能体能够根据语言指令和视觉信息导航至目标位置。当前VLN研究主要集中于地面智能体,而基于无人机的VLN研究相对较少。本文从平台、基准和方法三个维度系统性地解决了无人机VLN面临的挑战。

简介
摘要部分指出了当前VLN研究存在的局限性——大多数研究聚焦于地面智能体,而无人机VLN研究相对不足。作者敏锐地发现,现有的无人机VLN工作往往直接套用地面VLN的设置,依赖于预定义的离散动作空间,忽视了无人机与地面智能体在运动动力学和导航任务复杂性方面的本质差异。
这种差异主要体现在两个方面:运动动力学不匹配和导航任务复杂性差异。前者指无人机在三维空域中的自由运动特性与地面智能体二维平面运动的本质不同;后者则强调无人机常工作的户外开放环境具有路径长、视角多变等特点。
针对这些挑战,作者提出了三方面的解决方案:OpenUAV平台、目标导向的VLN数据集和UAV-Need-Help基准。
OpenUAV平台以其多样化的环境、真实的飞行控制和广泛的算法支持为特点;构建的数据集包含约12k条轨迹,是首个专为真实无人机VLN任务设计的数据集;UAV-Need-Help基准则通过提供不同级别的引导信息,协助无人机在复杂环境中完成导航任务。
此外,作者还提出了基于多模态大语言模型(MLLM)的无人机导航方法,利用MLLM的多模态理解能力联合处理视觉和文本信息,并进行分层轨迹生成。

引言部分阐述了研究的动机和理论基础。作者通过图1直观展示了传统固定动作集方法与真实无人机飞行动力学之间的差距——无人机在实际飞行中往往需要同时执行俯仰、俯冲和滚转等复合动作来实现空间运动,其轨迹本质上是连续的,难以分解为离散动作。这种简化会导致导航过程失真。同时,户外开放环境中,无人机的视野常被遮挡,且视角不断变化,仅依赖目标描述难以实现精确定位和导航。

相关工作
相关工作部分系统梳理了三个关键领域的研究现状:仿真平台、VLN数据集和基于LLM的导航智能体。
在仿真平台方面,作者指出地面仿真平台如Habitat、Matterport3D等已相对成熟,而无人机仿真平台仍处于早期发展阶段。现有平台如xView仅提供遥感卫星图像,不适合低空导航任务;一些结合UE与AirSim的平台则在渲染精度或连续轨迹VLN任务的算法支持方面存在不足。
表1通过对比现有VLN数据集,突显了本文数据集的创新性——首次纳入6自由度(6 DoF)连续轨迹,更真实地反映无人机飞行特性。在基于LLM的导航智能体方面,作者总结了LM-Nav、LMDrive等工作的贡献,同时指出这些方法在无人机导航任务中的应用仍有局限。

这部分分析清晰地揭示了研究空白:缺乏支持连续轨迹的真实无人机VLN仿真平台、缺少反映真实无人机6 DoF运动的数据集,以及需要更强大的导航算法处理复杂空中环境的挑战。这些空白正是本文旨在填补的。

OpenUAV仿真平台
OpenUAV平台是本文的核心贡献之一,其技术架构包含三个关键模块:环境构成、飞行仿真和算法支持,形成了一个完整的仿真生态系统。
在环境构成方面,平台整合了22种不同场景(城市、乡村、自然景观等)和89类对象资产,通过UE4的高保真图形渲染能力实现逼真视觉效果。特别值得注意的是,平台支持动态环境模拟,如植被摇曳和光照变化,这大大增强了仿真的真实性。对象放置API的设计尤为巧妙,预定义了每个场景中的可行区域和对象类别,使标注者能够将对象放置在合适的位置,这为目标导向的VLN任务奠定了基础。
飞行仿真模块通过集成AirSim插件实现了真实的6 DoF飞行控制。无人机位姿表示为

,其中(x,y,z)为位置坐标,

分别表示俯仰、滚转和偏航角。这种完整的6 DoF表示能够精确模拟无人机运动。平台还支持多种传感器(IMU、RGB和深度相机、LiDAR、GPS等)的配置,初始设置包括覆盖前后左右和下方视图的RGB和深度相机,以及360°水平视场的LiDAR传感器,用户可根据需要调整配置。
算法支持模块包含三大创新工具:异步数据收集框架解决了多传感器数据收集的时间延迟问题;闭环仿真接口允许灵活集成导航模型输出以控制无人机飞行;回溯策略在无人机发生碰撞时将其恢复到前一位姿,使用"教师动作"执行下一步,从而产生更长的导航轨迹。平台还采用环境并行化策略,在8块NVIDIA A100 GPU上实现了单无人机仿真16倍的性能提升,帧率可达160-1600 fps。
OpenUAV平台的创新之处在于首次为无人机VLN任务提供了完整的仿真解决方案,其6 DoF连续轨迹支持和物理真实的飞行动力学模拟,大大缩小了仿真与真实飞行之间的差距。平台的开源特性也将促进相关研究的进一步发展。


目标导向的真实无人机VLN数据集
本文构建的数据集是首个准确捕捉无人机复杂飞行动力学的VLN数据集,包含12,149条轨迹。数据集的构建过程分为描述收集和异步轨迹收集两个关键阶段。
在描述收集阶段,目标描述包含三个关键组成部分:
(1)目标方向,表示目标与无人机初始位姿的相对位置;
(2)对象描述,详细说明目标的视觉特征;
(3)环境信息,描述周围空间上下文。

如图6所示,作者利用GPT-4生成文本描述,并通过人工专家审查确保数据质量。提示工程的设计非常精心,强调从多个视角整合信息,优先描述周围对象>周围建筑>植被,且描述优先考虑颜色和形状。
异步轨迹收集阶段解决了传感器数据存储延迟导致的操作不连续问题。人类专家使用OpenUAV平台的人工控制界面手动控制无人机搜索目标,飞行过程中仅以固定时间间隔记录无人机状态,飞行完成后再通过并行数据收集框架获取传感器数据。当无人机接近目标5米内时轨迹记录终止,检测到碰撞的轨迹被丢弃。这种异步收集方法保证了轨迹的连续性和真实性。

图2展示了数据集的统计分析结果。根据轨迹长度将任务分为简单(<250米)和困难(≥250米)两类,目标距离范围从50米到400米,确保了任务的挑战性和多样性。目标对象集包含89个不同类别,涵盖车辆、人类、动物等多种对象。数据集被划分为训练集(9,152条轨迹)、测试可见集(1,410条轨迹)、测试未见地图集(958条轨迹)和测试未见对象集(629条轨迹),全面评估模型在已知和未知环境中的表现。
该数据集的创新价值在于首次将真实的6 DoF连续轨迹引入无人机VLN研究,通过异步收集方法和精心设计的描述生成流程,确保了数据的高质量和真实性,为后续算法开发提供了坚实基础。

UAV-Need-Help基准
UAV-Need-Help基准是本文的另一核心贡献,它创新性地提出了辅助引导的无人机对象搜索任务,解决了复杂空中环境中仅靠描述性指令难以完成搜索任务的挑战。
任务的形式化描述如下:
在每个episode中,无人机从初始位姿P0开始,接收目标描述I(指定目标方向、对象特征及其周围环境)。在每个时间步,无人机获取其状态S(位置、姿态、速度),以及来自五个视角(前、左、右、后、下方)的RGB图像R和深度图像D。辅助系统监测其状态并在需要时提供额外指令I'建议飞行策略。
在闭环仿真中,无人机导航模型基于{I,S,R,D}预测6 DoF轨迹序列,通过OpenUAV平台的飞行API导航至每个预测位姿。如果无人机降落在目标20米半径内,则认为任务成功。

辅助机制的设计体现了作者的深刻洞察。如图3(a)所示,根据提供的引导级别,定义了三种辅助类型:
· L1辅助提供与真实轨迹高度一致的高频引导,持续计算无人机当前位置到oracle路径中最近轨迹点的适当动作(巡航、转向或着陆),确保无人机始终保持在正确路径上。
· L2辅助仅在无人机遇到困难时介入,提供低频修正使其回到真实轨迹。当通过深度图识别到碰撞风险或无人机偏离真实路径太远时激活,提供纠正动作引导无人机返回期望轨迹。
· L3辅助仅当无人机处于危险场景时提供避障帮助。通过深度图确定当前位置与障碍物的距离,当检测到接近障碍物时发出避障命令。
这种分级辅助机制的设计非常巧妙,既反映了真实应用中无人机可能需要的外部支持水平,也为评估不同能力水平的导航算法提供了灵活框架。L1辅助相当于"全程引导",L2辅助是"关键点纠正",L3辅助则是"紧急避障",这三种模式覆盖了从强辅助到弱辅助的完整谱系。

无人机导航LLM
无人机导航LLM是本文的方法核心,其架构包含分层轨迹生成和回溯采样数据聚合两大创新模块,下面进行详细解析。
6.1 分层轨迹生成
分层轨迹生成模块包含多模态标记化和分层轨迹解码器两个关键组件。
多模态标记化过程将任务描述Itask、辅助指令Iinstr通过预训练语言标记器转换为对应标记。对于多视角图像,采用EVA-CLIP和Q-former结构提取视觉特征,每幅图像转换为1个捕获全局特征的上下文标记和16个通过网格池化表示局部细节的内容标记。最终拼接三种标记:图像标记Timg、任务描述标记Ttask和指令标记Tinstr,构成多模态输入标记序列Tinput=<Timg,Ttask,Tinstr>。
分层轨迹解码器采用两级结构:基于MLLM的轨迹解码器和细粒度路径解码器。前者使用可学习的轨迹标记Twp作为LLM输入,帮助提取轨迹特定特征Qwp,通过MLP解码目标位姿Ptarget。后者接收前视视觉标记

,将其与来自MLLM解码器的处理后的位姿特征结合,通过MLP生成细粒度轨迹Ptraj。整个过程可表示为:

其中ftarget表示将MLLM输出的目标位姿与视觉标记维度对齐的过程。为提高目标附近着陆精度,还采用了Grounding DINO模型进行检测,当在多视角图像中识别到目标对象时,导航器启动着陆过程。
这种分层设计充分考虑了无人机导航的特点:高层MLLM基于全局信息规划大致方向,低层路径解码器则负责生成可执行的细粒度轨迹,两者协同实现了长距离和精细导航的统一。
6.2 回溯采样数据聚合
针对无人机飞行仿真中碰撞导致完整轨迹收集困难的问题,作者创新性地提出了回溯采样机制,扩展了传统的DAgger(数据集聚合)方法。
当无人机基于模型输出的动作导致碰撞时,系统将其状态恢复到两帧前的位姿,然后遵循导师模型给出的轨迹执行下一步。这种方法使无人机能够从碰撞中恢复,保持在正确轨迹上,从而收集到更多成功的避障轨迹。通过这种方式,模型能够学习到更多临界避障情况下的正确行为,显著提升了导航能力。

实验分析
实验部分进行了全面的定量和定性评估,验证了方法的有效性。
7.1 定量结果

表2展示了在测试可见集上不同难度级别和辅助级别的结果。本文方法在所有指标上均优于基线,在L1辅助下SR指标比CMA模型平均提高5%。这表明基于MLLM的分层轨迹生成方法增强了场景理解能力,产生了更准确、适应性更强的位姿序列。经典基线模型CMA由于模型规模和任务复杂度的限制表现不佳,随机和固定方法几乎无法完成任务,证明了仅靠指令和视觉信息难以完成目标搜索任务。

表3展示了在未见对象集(UO)和未见地图集(UM)上的泛化能力。本文方法在UO上表现出比可见集稍高的成功率,这归因于Grounding DINO模块的固有泛化能力和数据相对简单的特性。在UM上性能虽有下降,但仍优于其他方法,显示了良好的零样本适应能力。

表4报告了不同训练数据量下的性能变化,表明更大规模、更多样化的数据集可以持续提升模型性能,为未来研究指明了方向。
7.2 定性分析
图4展示了OpenUAV平台中的导航实例。前两行显示无人机成功遵循指令,在建筑间机动并最终定位黄色车辆。值得注意的是第三到第五幅图像展示了无人机执行转向机动导致的视角变化,体现了平台的逼真性。第三行则展示了一个失败案例,无人机在森林场景中与树木碰撞,说明了复杂环境带来的挑战。
图7提供了更多示例,展示了更长轨迹和在不同场景中的改进导航性能。



结论与展望
本文从平台、基准和方法三个维度系统性地推进了真实无人机VLN研究。OpenUAV平台提供了真实环境、飞行仿真和全面的算法支持;构建的目标导向真实无人机VLN数据集和提出的UAV-Need-Help基准为领域研究提供了统一评估框架;无人机导航LLM和回溯采样数据聚合策略有效提升了基于真实轨迹的VLN任务性能。
未来方向:
(1)增强无人机在最少引导下的自主导航能力,使其能在复杂环境中有效运行;
(2)改进从仿真到实际部署的可迁移性,促进无人机在现实场景中的应用。
这些方向将推动VLN技术向更高自主性和实用性发展。