| Issue |
JNWPU
Volume 44, Number 2, April 2026
|
|
|---|---|---|
| Page(s) | 380 - 392 | |
| DOI | https://doi.org/10.1051/jnwpu/20264420380 | |
| Published online | 12 June 2026 | |
Hierarchical planning and control for multi-UAV cooperative encirclement in complex environments
复杂环境下多无人机协同围捕的分层规划与控制
1
School of Automation, Xi'an University of Posts and Telecommunications, Xi'an 710061, China
2
School of Astronautics, Northwestern Polytechnical University, Xi'an 710072, China
Received:
12
October
2025
Abstract
In complex environments, multi-UAV cooperative encirclement tasks often face critical challenges such as low intruder trajectory prediction accuracy, excessive system energy consumption during task allocation, and insufficient obstacle avoidance capability under dynamic conditions. These issues severely limit the efficiency and reliability of encirclement operations. To address these problems, a two-stage cooperative encirclement framework consisting of a gathering phase and a guidance phase is proposed in this paper. In the gathering phase, an interpolation and error-correction polynomial fitting(IEC-PF) method is designed to achieve early interception and significantly improve the accuracy of intruder trajectory prediction. For the task allocation of capture points, an iterative convex optimization-based allocation strategy is developed to minimize total system energy consumption while strictly satisfying the final capture formation constraints. In the guidance phase, UAVs construct an optimal encircling formation based on the assigned capture points. Within the generated obstacle-free convex regions, a nonlinear optimization method is used to compute optimal global paths and formation configuration parameters. An affine formation control strategy based on stress matrices is further introduced to ensure formation stability and reconfiguration during path tracking. Additionally, a deep reinforcement learning(DRL)-based local obstacle avoidance mechanism is integrated to enhance the system's real-time responsiveness to dynamic obstacles. Simulation results demonstrate that the proposed framework substantially improves obstacle avoidance performance in complex environments and enables reliable multi-UAV cooperative capture of intruding targets, as well as guiding them to designated areas.
摘要
在复杂环境下, 多无人机协同围捕入侵目标时, 常面临目标轨迹预测精度欠佳、任务分配过程中系统能耗过高及动态环境下避障能力不足等关键挑战, 严重制约了围捕任务的效率与可靠性。针对上述问题, 提出一种包含聚集阶段与引导阶段的两阶段多无人机协同围捕框架。在聚集阶段, 为实现对入侵目标的提前拦截, 设计插值与误差校正的多项式拟合(IEC-PF)方法, 有效提升目标轨迹预测精度; 针对围捕点分配问题, 提出基于迭代凸优化的任务分配策略, 在严格满足最终围捕编队约束条件的前提下, 实现系统总能耗最小化。在引导阶段, 无人机依据分配的围捕点构建最优包围编队, 基于生成的无障碍凸区域, 通过非线性优化算法求解最优全局路径及编队构型参数; 引入基于应力矩阵的仿射编队控制策略, 保障无人机在路径跟踪过程中编队的稳定与重构; 融入基于深度强化学习(DRL)的局部避障机制, 显著提升系统对动态障碍物的实时响应能力。仿真实验结果表明, 所提框架能够显著增强系统在复杂环境下的避障性能, 有效确保多无人机成功协同围捕入侵目标并将其引导至目标区域。
Key words: multi-agent cooperative hunting / trajectory prediction / task allocation / nonlinear optimization / affine formation tracking control / dynamic obstacle avoidance
关键字 : 多智能体协同围捕 / 轨迹预测 / 任务分配 / 非线性优化 / 仿射编队跟踪控制 / 动态避障
© 2026 Journal of Northwestern Polytechnical University. All rights reserved.
This is an Open Access article distributed under the terms of the Creative Commons Attribution License (https://creativecommons.org/licenses/by/4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original work is properly cited.
低空经济作为新兴经济形态,其快速发展推动了无人机在物流配送、城市巡检、应急救援等领域的广泛应用,但“乱飞”等违规问题频发,无人机未经报备闯入敏感低空空域,会干扰交通秩序、威胁人员财产安全[1]。而传统围捕方法中人工巡查与识别效率低,难以应对复杂低空空域内的无人机活动,现有固定式围捕系统则存在部署成本高、灵活性不足的问题,难以适配动态防控需求,导致围捕响应滞后、漏捕率高。当前低空空域无人机安全管控与围捕能力亟待提升。
多智能体协同围捕作为应对动态目标拦截的有效手段,已成为无人系统领域的研究热点,并取得一系列进展。早期研究以仿生启发式算法为核心。Cao等[2]提出仿生协同搜索学习算法(biomimetic cooperative search learning algorithm, BCSLA),实现动态目标捕获与避障强化;吴子沉等[3]通过神经网络实现协同围捕,但仅适用于单任务场景。近年来,研究重心逐渐转向强化学习(reinforcement learning, RL)方法。杨梓豪等[4]将基于选项的分层强化学习方法引入到多无人机目标协同围捕过程,但仅适用于小型无人机集群的简单任务;Zheng等[5]融合博弈论与Q-learning学习,优化围捕与目标追踪效果;孙懿豪等[6]结合深度强化学习(deep reinforcement learning, DRL)与博弈论,提升未知环境下的捕获效率;针对无人水面艇(unmanned surface vehicles, USVs),Xia等[7]提出多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO),优化围捕效率与安全性。
围捕任务通常涉及对智能体的路径规划及多智能体的控制。路径规划对于围捕任务的可靠运行至关重要,需综合考虑各类约束以生成安全无碰撞的路径。传统路径规划算法(Dijkstra、A*、APF)[8–10]对动态障碍物响应滞后;环境分解方法(如梯形分解和三角形分解)[11–12]虽能实现完整区域划分,但生成的单元较小,会降低规划效率。Voronoi方法能有效定义静态环境的障碍边界[13],但在实际应用中,用凸区域近似非凸自由空间往往更有效。Liu等[14]提出的“安全飞行走廊”通过构建重叠凸集增强避障能力;Dai等[15]采用双层优化方法迭代生成多边形,在最大化椭球体积的同时分离智能体与障碍物,但计算成本较高;Marcucci等[16]采用矩形表示无碰撞通道以实现更平滑的路径设计;Chen等[17]利用局部感知点云数据生成星形区域,但其非凸性增加了编队优化的复杂性。
为应对动态环境,DRL已被应用于基于视觉输入与传感器融合的智能体导航及障碍物规避[18]。深度确定性策略梯度(deep deterministic policy gradient, DDPG)已被应用于三维城市环境中的无人机导航[19],但仍存在探索效率低下和实时适应性差的问题[20]。由于强化学习依赖试错机制,智能体在训练初期难以快速习得有效策略,导致对样本量要求较高[21]。为解决此问题,Niu等[22]提出基于人类示范的端到端强化学习方法,在DDPG框架中融入优先经验回放(prioritized experience replay, PER)机制,显著提升学习效率。该方法可实现实时导航避障,但在已知特定环境中应用时,可能因耗时长、探索路径冗长导致不必要的能量消耗。
在多智能体的编队控制方面,传统控制方法存在明显局限:领导者-跟随者方法[23]易过度依赖领导者,易因领导者故障影响整体;基于行为方法[24]难以定义整体行为,协调性不足;虚拟结构法[25]对动态环境适应性差,难以应对突发障碍。近年来,编队控制通过融合一致性理论,引入了复拉普拉斯矩阵[26]和应力矩阵[27],提升目标编队的定义精度。Han等[28]提出的分布式控制策略,借助复拉普拉斯矩阵定义编队形状,可确保智能体收敛至目标构型,但仅适用于二维环境;应力矩阵也是实现编队机动的有效工具,Zhao[27]提出仿射编队控制律,能在机动过程中实现动态调整编队形状,但局限于简单线性运动学,难以应用于非线性运动学模型。
尽管上述研究已分别解决了围捕任务中各个子问题,但仍存在不足,例如目标预测精度低、任务分配效率低下、避撞能力不足。为应对上述挑战,本文提出一种分层协作围捕框架,将围捕任务分解为聚集与引导2个控制阶段。每个阶段均针对特定子问题设计策略,从而实现动态环境下高效、灵活且安全的多无人机围捕。本文主要贡献包括:
1) 提出一种分层控制架构,将轨迹预测、能量最优的任务分配、全局路径规划、局部动态避障、编队控制结合,完成对入侵目标的围捕;
2) 提出基于迭代凸优化的围捕点分配方法,求解能量最优的分配并构建满足约束的围捕编队,结合插值及误差校正的多项式拟合(interpolation and error correction polynomial fitting, IEC-PF)方法,精准预测入侵目标轨迹并实现拦截,降低无人机能耗;
3) 提出融合了基于非线性优化的全局路径规划与基于深度学习的局部动态避障的策略,通过非线性优化全局路径,得到具有最优编队构型参数的无碰撞路径,并由深度学习策略实现局部动态避障,进一步保障围捕的安全性与实时性。
1 问题描述
1.1 图论
考虑在空间Rd中由n个固定翼无人机组成的多智能体系统, 各无人机间的拓扑关系由无向图G=(V, E)描述。图的节点集记为V={1, 2, …, n}, 边集E⊆V×V表示节点之间的边集合。边(i, j)∈E表示无人机i从无人机j获取信息。编队(G, p)将多个固定翼无人机关联为无向图G, 其中pi∈Rd表示无人机i的位置。无人机分为领导者和跟随者2类, Vl={1, 2, …, nl}被定义为领导者, Vf=V\Vl为跟随者, 位置分别由pnl=[p1T, p2T, …, pnlT]T和pf=[pnl+1T, pnl+2T, …, pnT]T表示。
1.2 应力矩阵
应力矩阵Ω可以同时表征编队的通信拓扑结构与几何约束条件。对于编队(G, p), 应力定义为分配给该编队边集的一组标量参数, 即对于编队中的任意边(i, j)∈E, 均对应一个标量应力值
。当应力值满足
时, 编队的平衡应力状态即得以建立。
平衡约束的矩阵形式为
, 其中Id为单位矩阵,
表示克罗内克积。
可根据领导者和跟随者被分块为
(1)
式中:
, 如果仿射可定性条件成立[27], 则跟随者的位置可以由领导者的位置唯一确定, 即
。
1.3 仿射编队
仿射变换是包含线性变换与平移操作的几何变换, 可实现对目标对象的平移、缩放、剪切、旋转, 以及由多个单一变换构成的复合变换(见图 1)。
![]() |
图1 仿射变换 |
标称编队被定义为
表示固定翼无人机编队的仿射变换基。时变仿射编队被定义为
(2)
式中:A(t)∈Rd×d是时变变换矩阵, 包括选择、剪切、缩放;b(t)表示平移;1n是单位向量。无人机i的期望位置由
得到。
因此, 固定翼无人机的控制目标设定为跟踪其目标时变位置, 即当t→∞时, 编队收敛于目标
。
1.4 无障碍区域
假设在全局地图中存在一组静态障碍物,
定义膨胀障碍物集合, 固定翼无人机在位置p所占据的区域为S(p)⊂R2, 则障碍物集合可以表示为
(3)
对于静态障碍物, 自由空间可以表示为
(4)
1.5 运动学模型
假设所有固定翼无人机均在同一高度飞行, 则每架无人机可被简化为质点。基于此假设, 固定翼无人机的运动方程可表述为[29]
(5)
式中:pi=(xi, yi)T表示无人机i的位置; θi为无人机i的航向角。Xi=[xi, yi, θi]T表示无人机i的状态变量, 控制量为Ui=[ui1, ui2]=[vi, wi]T, 线速度vi和角速度wi分别受到(6)式约束。
(6)
式中:vmax分别为最大线速度;ωmax为最大角速度。
2 方法
为实现复杂环境下固定翼无人机的协同围捕任务, 本文提出了一种包含聚集阶段与引导阶段的分层规划与控制框架。在聚集阶段, 首先对入侵者轨迹进行预测, 再结合地图环境信息与入侵者实时位置, 完成围捕点的优化分配; 在引导阶段, 首先, 基于无障碍凸区域, 通过非线性优化算法求解全局无碰撞路径; 同时, 对于动态障碍物, DRL算法利用领导者的激光雷达数据、目标点和速度信息, 生成实时速度控制指令; 最后, 采用基于应力矩阵的仿射编队控制策略, 进行目标跟踪与编队重构。该分层规划与控制框架的整体结构如图 2所示。
![]() |
图2 多无人机协同围捕的分层规划与控制 |
2.1 聚集阶段
围捕无人机初始被随机部署于任务区域内, 其首要任务是获取入侵者位置信息, 基于该位置预测入侵者的短期运动轨迹, 在入侵者周围生成目标围捕点, 并完成围捕点的分配, 使得所有无人机均能沿最短路径抵达各自分配的目标围捕点。
2.1.1 多项式拟合轨迹预测
在二维空间中, 移动目标的运动轨迹是一条连续的曲线, 而实际观测中仅能通过特定频率对其采样, 得到离散轨迹点。根据采样定理可知, 连续信号可以由固定时间间隔的离散采样点重构, 因此, 移动目标轨迹的预测问题可转化为对离散采样点的预测问题。
轨迹预测为基于有限数量的观测轨迹样本构建预测模型, 再利用该模型估计目标随时间推移的未来位置。对于n个轨迹采样点P1(x1, y1), P1(x2, y2), …, Pn(xn, yn), 可以通过拟合一个m次多项式对轨迹进行近似表示, 该多项式用于计算xi对应的位置yi(i=1, 2, …, n), 表示为
(7)
式中:m表示多项式的阶数;[a0, a1, …, am]T为通过最小二乘法求解得到的多项式系数矩阵, 将系数矩阵代入(7)式中, 可以推导出曲线拟合的最优解, 利用该最优解, 即可实现对目标下一时刻轨迹点Pn+1的预测, 即
。
对于复杂运动轨迹, 短期内目标的未来轨迹主要依赖近期运动状态, 与远期的历史轨迹无显著关联性。因此, 对入侵目标移动轨迹进行实时采样, 获取多项式拟合所需的历史轨迹点集, 假设目标短期沿拟合轨迹运动; 随着目标的移动, 采样数据实时更新并重新计算预测位置, 实现采样窗口动态滑动如图 3所示, 目标移动时远期采样点被近期采样点逐步替换, 即实现采样窗口的动态滑动。
![]() |
图3 动态滑动采样轨迹预测模型 |
采样频率决定的采样间隔会影响轨迹预测精度。相邻2次预测的误差呈现出一致的趋势, 该特性可用于制定预测值更新策略。由于预测误差随预测点数量增加而增大, 且同一预测位置误差大小相近, 本文进一步提出插值与误差校正多项式拟合(IEC-PF)方法, 通过对采样点插值获得更密集的点, 并利用预测值之间的误差更新预测值, 以提升目标轨迹预测的准确性。
该算法的输入是待拟合点集P, 其由近期历史轨迹点构成。算法主要重复以下步骤, 输出最终预测点集合:
1) 初始化采样窗口大小W和预测次数K;
2) 对输入点集P进行插值, 生成更密集的点集Pnew;
3) 执行K次拟合预测以生成K个预测点: 在第i次预测时, 选取Pnew中最后的W个点
进行曲线拟合, 计算得到新预测点Pi, temp, 并将该点存入预测集合P′中, 该过程重复执行K次, 形成最终的初始预测点集合P′;
4) 实施误差修正以提升预测精度: 计算第i-1次预测的误差ei-1=P′i-1-Pi-1, new, 其中P′i-1表示预测值, Pi-1, new为对应时刻的实际观测值; 然后基于ei-1进行单次误差修正, 更新预测值P′i, new, 并计算修正后的误差ei, new; 通过多轮误差修正, 最终得到目标预测结果P*。
算法1 插值和误差修正多项式拟合
1 输入: 待拟合点集P
2 输出: 预测点集P*
3 初始化滑动窗口大小W、预测点数K
4 Pnew=interp1(P) //获取更密集的点集
5 for i=1, 2, …, K
6
//对于第i次预测, 选取最后W个
7 Pi, temp=curvefitPredict(
) //拟合预测点
8 P′=append(Pi, temp) //保存每次预测结果
9 end for
10 //误差修正
11 for i=2, 3, …, K
12 ei-1=P′i-1-Pi-1, new //第i-1次的预测误差
13 P′i, new=P′i-k1×ei-1
14 ei, new=P′i, new-Pi, new
15 Pi*=P′i-k1×ei-1-k2×ei-1, new //最终预测值
16 end for
2.1.2 围捕点分配
在围捕任务中, 围捕点分配的核心目标是基于入侵者的预测位置, 为各无人机计算最优围捕点(见图 4), 构建满足预设几何约束的围捕编队, 同时实现编队建立过程的能量消耗最小化。编队的几何约束可由一组参考参数确定, 例如圆形编队, 若已知圆心、半径及无人机数量, 参考参数可以视为无人机的圆周偏转角δ, 相邻无人机的角度间隔由φ=2π/n固定。因此, 围捕点的分配本质是通过优化参考参数, 结合无人机运动学约束、控制输入约束等, 使各无人机从初始位置运动至目标围捕点的系统总能耗最低。
![]() |
图4 围捕点分配 |
为实现能耗最小化且满足相关约束, 将围捕点分配与编队建立过程统一建模为最优控制问题。
以控制输入能耗总和最小为优化目标, 目标函数定义为
(8)
该最优控制问题受到的约束有:
1) 动力学约束: (5)式中的动力学约束可表述为
(9)
式中, fi∈R3为(5)式等号右边项。
2) 控制输入约束: (6)式中的控制输入约束可以表示为
(10)
式中:Ui, j是个无人机i的控制向量的第j个分量;
为第j个分量的最大控制量;t0和tf分别为初始时间和终止时间。
3) 初始约束
(11)
式中, Xi0是个无人机i的初始状态。
4) 状态约束
(12)
式中,
为无人机i的航向角上界, 该约束用于避免无人机因过度转向导致失稳。
5) 最终编队队形约束: 各无人机的目标围捕点需满足圆形编队的几何要求, 即无人机最终状态Xi(tf)由参考参数Xref决定。
(13)
在圆形编队中, 将偏转角δ作为Xref, 与最终状态Xi(tf)的关系如(14)式所示。
(14)
圆形编队的圆心表示为[xc, yc]、半径为R, φ为n个无人机之间的角度间隔。
对于该最优控制问题, 首先将其转换为一个非线性规划问题, 采用控制向量参数化方法实现; 其次, 确定状态约束和最终编队约束相对于所有优化变量的梯度; 最后将能量最优控制问题近似为迭代凸规划(SCP)问题进行求解。
1) 控制向量参数化
根据标准的控制向量参数化方法将控制向量近似成一个分段常值函数。首先, 将时间区间[t0, tf]分成N个子区间, 即
(15)
对于无人机i, 在每个区间内, 控制向量Ui近似为常值σik, 如(16)式所示。
(16)
控制参数化后, 能量最优控制问题可以被重新建立, 将(16)式代入(9)式, 动力学方程可以表示为
(17)
对于无人机i, 将所有满足控制约束(10)式的常值控制参数σi的集合记为Ξi, 若给定σi∈Ξi, 可以利用(11)式中的初始条件求解(17)式, 得到Xi(τ)。该问题可归为初始值问题(IVP), 求解方法主要分为单步法、多步法和配置法。常见的单步法有龙格-库塔(RK)方法, 直接通过当前步状态计算下一步状态; 多步法根据问题特性选择适配方法, 如用于非刚性问题的Adams-Bashforth法、用于刚性问题的向后差分法; 配置法通过分段多项式近似各子区间内的状态变量以实现求解。求解得到无人机飞行轨迹后, 即可重新构建如(18)式所示的编队队形约束。
(18)
式中, Xi(tf|σi)为由N个子区间对应的σi求得的无人机i的最终状态解。
基于上述分析, 可以将围捕点的分配与编队建立问题表达为更简单的形式
(19)
该问题可以视为非线性优化问题, 其优化变量为参考参数Xref及常值控制参数σi, 为便于简化后续推导, 将优化变量记为ξ=[σ1T, σ2T, …, σnT, Xref]T。对于非线性规划问题, 可以使用迭代二次规划方法(SQP)、内点法或者迭代凸规划(SCP)方法求解, 因SCP方法简单高效且开源, 本文采用SCP方法。
2) 迭代凸规划方法
采用灵敏度法计算状态约束(12)式与最终编队队形约束(13)式相对于优化变量ξ的梯度, 通过联立求解动力学方程与灵敏度辅助方程, 得到状态变量对σi的偏导数, 为凸规划提供精确的线性化基础。
利用凸规划(SCP)将非线性规划问题近似为一系列凸优化问题, 通过迭代逐步逼近最优解。在问题(19)中, 仅需对状态约束与最终队形约束进行近似。这2类约束相对于优化变量的梯度可通过积分求得, 因此采用一阶泰勒展开完成近似。对于第k次迭代, 通过引入优化变量ξ, 利用问题(20)对问题(19)进行凸逼近, (20)式为典型的凸优化问题。为确保初始猜测值任意选择时的全局收敛性, 需在ξ上施加信任域, 但目标函数中仅含优化变量中的控制参数, 因此信任域仅需针对该部分进行参数设定, 如(21)式所示。
(20)
(21)
迭代过程为:
1) 初始化控制参数σi0;
2) 在第k次迭代中, 基于当前迭代点ξk, 对状态约束与最终编队约束进行一阶泰勒展开, 将目标函数(8)式近似为二次型函数, 形成凸优化子问题, 通过开源CVX求解;
3) 若满足收敛条件||ξk+1-ξk<ε||, 迭代终止, 得到最优偏转角, 代入(14)式可得最优围捕点; 若未收敛, 则进入下一次迭代。
通过上述流程, 可在满足所有约束的前提下, 为各无人机分配能耗最优的围捕点, 同时确保多机可快速构建预设的圆形围捕编队, 为后续围捕任务的执行奠定基础。
2.2 引导阶段
当围捕无人机成功抵达指定的围捕点并建立围捕编队后, 进入引导阶段。这一阶段在无障碍凸区域内进行非线性全局路径规划, 并使用深度强化学习方法实现局部避障, 为了追踪轨迹并重构编队, 采用了基于应力矩阵的仿射编队跟踪控制。
2.2.1 全局路径规划
为确保围捕编队在引导入侵者至安全区域的过程中, 既满足无碰撞约束又能实现队形构型优化, 本文对基于非线性优化的全局路径规划方法进行改进。首先在任务区域自由空间内生成离散采样点, 并基于该采样点集确定对应的无障碍凸区域; 再引入约束优化, 既确保编队在每个采样点处的构型均在无障碍凸区域内, 又避免编队内部发生碰撞; 最后采用图搜索算法, 对所有采样点进行路径搜索, 最终确定安全且成本最低的全局最优路径。
1) 无障碍凸区域: 无障碍凸区域是指在自由空间中不包含任何障碍物的凸多边形, 如图 5所示。无障碍凸区域可以通过一组线性约束方程描述, 即
![]() |
图5 无障碍凸区域 |
(22)
式中:x为采样点;Aq表示超平面系数矩阵;bq为列向量。
本文使用IRIS[15]在任务环境中生成无障碍的凸区域。针对任意采样点, 首先构建一组超平面将该采样点与周围障碍物分隔开, 然后将该区域膨胀, 生成该超平面界定的最大体积椭球体; 重复该过程, 寻找能将当前椭球体与障碍物进一步分隔的新超平面, 最终形成最大的无障碍凸区域。
2) 编队构型的非线性优化: 为了在无障碍区域内实现最优的编队构型, 本文采用了非线性优化方法, 目标为最小化构型参数的误差。
(23)
式中,wt, ws表示设计权重; c表示成本;z表示编队构型, 它由大小s和平移t组成。编队中固定翼无人机的位置可以通过构型z获取。
(24)
式中:mj为当前构型的编队顶点;vj是在编队重构之后的编队顶点, 如图 6所示。
![]() |
图6 编队重构 |
约束条件1 为了避免编队与障碍物发生碰撞, 每个无人机的位置必须位于无障碍的凸区域Q内, 即Aq[t+smj]≤bq。
约束条件2 考虑到编队中无人机间的碰撞问题, 所有无人机之间要保持一个安全相对距离d, 本文设置d不小于无人机半径的2倍, 此约束条件可表示为d≥2rd。
上述优化通过非线性求解器MOSEK求解, 生成能够避免碰撞并实现编队重构的编队构型。
3) 全局路径规划: 全局路径规划生成编队的可行路径及中间构型。本文将无障碍凸区域与非线性优化方法相结合, 该方法可实现从起始点s到目标点g的全局路径求解。
在全局路径规划中, 图G=(V, E)表示编队路径与构型之间的关系, 每个节点V对应一个编队构型和位置, 如果构型z完全位于一个凸区域Q内, 则构型z被视为有效。因此, 图中的每个节点都对应着一个可行的构型。边E将不同的节点连接起来, 表示构型之间的可能转化, 对于每一个凸区域Q∈
, 其中
是现有凸区域列表, 不断更新构型列表, 包含所有编队构型完全位于该凸区域内的情况。节点列表V由初始构型zs和最终构型zg初始化, 其质心分别为s和g。凸区域列表分别初始化为Qs和Qg。
基于采样方法, 在工作区域内随机采样, 每个采样点对应一个节点, 然后在节点之间建立边, 表示从起始点到目标点的可能路径。如果采样点位于障碍物或列表
中的任何多边形内, 则剔除, 否则, 执行以下步骤:
1) 随机生成采样点p, 生成凸区域Qp;
2) 对于与Qp相交的每一个凸区域Q∈
, 计算使得编队完全位于这2个凸区域交集内的构型z, 并最小化其质心到目标点g的距离。该构型通过上述非线性优化方法计算得出;
3) 当有效构型z被添加到节点列表中时, 会为所有构型添加一条边{z, zi, Qp}, 并会为所有构型
添加另一条边。这样就能确保该结构能够通过相关的凸区域在2个构型之间进行移动。
随着采样的进行, 动态更新图的节点和边, 实现图结构的逐步扩展。当图构建完成后, 采用A*算法对全局路径进行搜索。对于连接2个构型z1和z2的每条边, 其代价定义为z1和z2的质心之间的欧式距离d(z1, z2)。
2.2.2 局部动态避障
为应对全局路径跟踪过程中的突发动态障碍物, 本文采用基于强化学习(DRL)的局部避障策略。该算法不需要精确的地图信息, 能将传感器数据直接映射为速度指令, 实时响应突发障碍物。本文采用领导者-跟随者结构, 上述生成的速度指令将作为领导者的控制输入, 以引导整个编队完成避障动作。
1) 观测状态与动作空间: 观测状态由向量σt表示, 包含激光雷达数据Lt、速度信息vt及目标相对位置gt。Lt是最大距离归一化的数组, 速度vt用极坐标表示, 动作空间vt包含线速度vlt与角速度vwt。
2) 奖励空间: 当无人机沿规划的全局路径行驶时, 需应对环境中未知的动态障碍物。奖励函数用于驱动无人机飞向目标航点并规避未知障碍物, 可以被设计为
(25)
式中:γsum表示总奖励, γg, γc和γv分别表示目标距离奖励、避障奖励和速度奖励。目标距离奖励γg可由(26)式计算。
(26)
当无人机与目标的距离dg低于阈值dgmin时, 无人机获得到达奖励γa, 否则, 获得的奖励等于上一个时间步长内移动的距离。kg为可调参数。避障奖励γc可定义为
(27)
式中, do表示无人机与障碍物的距离, 若do小于阈值domin, 则无人机避障获得负奖励。速度奖励γv定义为
(28)
(29)
(30)
式中:vwmax和vlmin分别定义为最大角速度和最小线速度。鼓励无人机以更快的线速度和更慢的角速度抵达目标位置, 因此, 若角速度vw超过vwmax, 或线速度vl低于vlmin, 无人机将分别获得惩罚奖励-γw和-γl。
3) 网络结构: 图 7~8为动作网络与评价网络的结构。动作网络的输入为24维的激光雷达数据、2维的相对位置及2维的速度信息, 由3层全连接层处理后输出线速度与角速度。评价网络融合动作网络的输入与输出, 应用3层带ReLU激活函数的全连接层, 最终通过线性激活函数输出Q值。
![]() |
图7 动作网络的结构 |
![]() |
图8 评价网络的结构 |
4) 人类演示数据采集: 该方法使无人机能够直接从人类操作中学习。状态数据σt包含激光扫描信息Lt、相对位置信息gt和速度信息vt。速度指令vt通过键盘输入, 奖励值由(25)式计算得出。经验数据集(σt, vt, σt+1, γt)存储于数据缓冲区中。
5) 优先经验回放: 为提升训练效率, 引入优先经验回放(prioritized experience replay, PER)算法, 并将其与DDPG算法融合。与传统均匀采样策略不同, PER通过对经验池数据按重要性赋予优先级, 优先采样对模型更新贡献更大的关键经验。优先经验回放算法的设计原理为
(31)
式中:采样概率pi对应第i次转换;a为分布系数;ρi表示转换数据集优先级, 即
(32)
式中:δ表示时间误差;μ|aQ(si, αi|θQ)2代表损失; μ为贡献系数; φ指每次转换的次要正采样概率; φD表示额外采样概率, 用于提高运行数据的选取率。每次转换均被评估为
(33)
式中:N为批次大小;b是调整采样权重的常数;λi为动作网络中的采样权重, 反映每个状态转移数据的重要性。
2.2.3 编队跟踪控制
为实现编队对全局路径的稳定跟踪与动态重构, 本文采用基于应力矩阵的仿射编队控制策略。在领导者-跟随者控制框架下, 该控制律能够使无人机追踪时变目标构型, 确保编队重构与维持。在该控制律的作用下, 无人机当前位置pf(t)可收敛至期望位置pf*(t), 确保(34)式的位置误差趋近于零。
(34)
1) 无饱和约束: 对于无速度饱和约束的跟随无人机, 其控制律可设计为
(35)
式中,
由矩阵
的第2i-1行和第2i行组成。
被定义为
, 其中
。设
及
, 其中hi表示无人机的方向向量, hi⊥与hi正交。

(36)
因此, 运动学模型(5)式可以被简化为
(37)
因此, 对于无人机i∈vf, 当vi>0时, 跟随者的跟踪误差δpf可收敛至零。
控制律(35)式的证明过程详见文献[29], 该控制律可分为2个主要部分: 第一部分为固定翼无人机构建位置共识协议, 用于实现多机位置的协同收敛; 第二部分则聚焦于协调领航机与跟飞无人机间的速度匹配, 以保障编队运动的一致性。基于上述控制律, 所提多固定翼无人机系统可实现对多种类型参考轨迹的稳定追踪, 及任意时变仿射变换下的编队构型调整。
2) 饱和约束: 实际应用中, 固定翼无人机通常受速度等约束限制。因此, 考虑(6)式的速度饱和约束, 控制律可设计为
(38)
3 仿真结果
为了验证多无人机协同围捕分层规划与控制框架的有效性, 从目标轨迹预测、围捕点分配、路径规划及避障、编队跟踪控制等多方面进行了MATLAB仿真。任务区域设置为15 m×15 m, 其中随机分布蓝色静态障碍物和黄色动态障碍物(见图 9a))。5个围捕无人机被随机分布在环境内, 一旦检测到入侵者, 则触发协同围捕分层规划与控制框架。
![]() |
图9 无人机在动态障碍环境中的围捕仿真结果 |
图 9a)~9b)展示了多无人机协同围捕分层规划与控制框架的聚集阶段, 该阶段包含入侵者的轨迹预测及围捕点分配, 形成围捕编队。对于入侵者轨迹预测, 采用插值与误差校正多项式拟合(IEC-PF)方法, 设置采样窗口大小W=3、预测次数K=5、多项式阶数m=3。基于迭代凸优化的围捕点分配中, 对于状态约束, 无人机航向角上界都设置为90°, 围捕无人机的初始状态Xi0为随机位置, 所有控制参数的信任域半径设为0.02, 限制迭代次数为50, 该最优控制问题使用CVX进行求解。
如图 9c)所示, 当围捕者抵达分配的围捕点时, 会自动形成围捕编队, 系统进入引导阶段。标称编队(G, r)如图 10所示, 前3个无人机被指定为领导者, 应力矩阵的权重分布于每条边上, P(r)为无人机在标称编队中的位置。以满足仿射可定位性条件, 并计算标称编队的应力矩阵Ω[27]。随后进入引导阶段, 该阶段包含全局路径规划、编队跟踪控制及动态障碍物躲避。
![]() |
图10 标称编队及应力值 |
在有密集障碍物的静态环境中, 将基于非线性优化的全局路径规划方法与基于Voronoi的方法进行对比。非线性方法可以显著提升路径质量, 2种场景中路径长度分别缩短了21.9%和11.9%, 曲率降低了76.9%和68.4%, 提升了多无人机路径规划效率、路径平滑度, 进而减少能量消耗。
使用具有速度约束的仿射编队控制跟踪全局无碰撞路径, 结果表明, 所有无人机均能在无障碍凸区域内实现跟踪路径(如图 9d)~9e)所示)。由非线性路径规划得到中间路径点的编队需缩放0.3倍, 在图 12b)中用不同底色区分聚集和引导2个阶段, 可以看出, 各无人机的间距始终保持在安全阈值2rd=0.18 m以上, 实现了无碰撞运行。当遇到未知动态障碍物时, 采用基于深度强化学习(DRL)的局部避障方法, 在Gazebo环境中完成训练, 并在TurtleBot3机器人上进行测试(如图 9f)所示), 使机器人在导航至红色目标的同时进行避障, 训练参数详见表 1。遇到动态障碍物时, 领导者通过DRL算法调整线速度与角速度, 在跟踪全局路径的同时实现避障。图 9d)~9e)、图 11也验证了系统的实时避障性能。
![]() |
图11 局部动态避障路径 |
![]() |
图12 围捕过程相关输出量 |
训练参数
总体而言,实验结果表明本文所提出的分层框架可有效、安全地完成围捕任务,在预测精度、任务分配、路径规划、编队跟踪及重构能力和避障性能方面均取得显著提升。
4 结论
本文针对复杂环境下多无人机协同围捕面临的预测精度低、围捕任务分配能耗高、避撞能力不足等问题,提出包含聚集阶段与引导阶段的多无人机协同围捕分层规划控制框架。在聚集阶段引入IEC-PF方法增强对入侵目标的短期轨迹预测,相较传统多项式拟合显著提升了预测精度,针对围捕点的分配提出基于迭代凸优化的分配方法,最小化系统能耗并构建满足约束的围捕编队。引导阶段采用基于非线性优化的全局路径规划,构建无障碍凸区域,生成的编队路径较Voronoi方法更平滑、更短,路径长度与曲率分别降低21.9%和76.9%;基于深度强化学习的局部避障算法显著提升动态障碍物实时响应能力;在固定翼无人机运动学约束下,仿射编队控制可以确保路径追踪与编队重构。本文所提框架可显著提升系统在复杂环境中的避障能力,且能有效保障多无人机协同完成对入侵目标的围捕任务,并将其引导至指定目标区域。
References
- ZHOU Meng, LI Jianyu, WANG Chang, et al. Multi-robot cooperative hunting: a survey[J]. Acta Automatica Sinica, 2024(12): 2325–2358 (in Chinese) [Google Scholar]
- CAO Z, GU N, TAN M, et al. Multi-robot hunting in dynamic environments[J]. Intelligent Automation & Soft Computing, 2008, 14(1): 61–72 [Google Scholar]
- WU Zichen, HU Bin. Swarm rounding up method of UAV based on situation cognition[J]. Journal of Beijing University of Aeronautics and Astronautics, 2021, 47(2): 424–430 (in Chinese) [Google Scholar]
- YANG Zihao, WANG Qingling. Multi-UAV cooperative encirclement method based on hierarchical reinforcement learning[J]. Journal of Naval Aviation University, 2025, 40(4): 567–575 (in Chinese) [Google Scholar]
- ZHENG Y, FAN W, HAN M. Research on multi-agent collaborative hunting algorithm based on game theory and Q-learning for a single escaper[J]. Journal of Intelligent & Fuzzy Systems, 2021, 40(1): 205–219 [Google Scholar]
- SUN Yihao, YAN Chao, XIANG Xiaojia, et al. Multi-UAV collaborative pursuit method via hierarchical reinforcement learning[J]. Control Theory & Applications, 2025(1): 96–108 (in Chinese) [Google Scholar]
- XIA J, LUO Y, LIU Z, et al. Cooperative multi-target hunting by unmanned surface vehicles based on multi-agent reinforcement learning[J]. Defence Technology, 2023, 29(11): 80–94 [Google Scholar]
- XIA J W, LUO Y S, LIU Z K, et al. Cooperative multi-target hunting by unmanned surface vehicles based on multi-agent reinforcement learning[J]. Defence Technology, 2023, 29: 80–94. [Article] [Google Scholar]
- BOROUJENI Z, GOEHRING D, ULBRICH F, et al. Flexible unit A-star trajectory planning for autonomous vehicles on structured road maps[C]//2017 IEEE International Conference on Vehicular Electronics and Safety, Vienna, 2017: 7–12. [Google Scholar]
- ZHANG Xiangfeng, TIAN Jiaquan, JIANG Hong, et al. Application research of improved artificial potential field method in robot path planning[J]. Machinery Design & Manufacture, 2026(3): 332–336 (in Chinese) [Google Scholar]
- SEIDEL R. A simple and fast incremental randomized algorithm for computing trapezoidal decompositions and for triangulating polygons[J]. Computational Geometry, 1999, 1(1): 556–564 [Google Scholar]
- AYANIAN N, KALLEM V, KUMAR V. Synthesis of feedback controllers for multiple aerial robots with geometric constraints[C]//2011 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2011: 3126–3131. [Google Scholar]
- WANG Qinhe, YIN Yongxin, DAI Li, et al. Trajectory planning of UAV based on Voronoi diagram and ant colony optimization algorithm[J]. Navigation Positioning & Timing, 2021(2): 66–73 (in Chinese) [Google Scholar]
- LIU S, WATTERSON M, MOHTA K, et al. Planning dynamically feasible trajectories for quadrotors using safe flight corridors in 3-D complex environments[J]. IEEE Robotics & Automation Letters, 2017, 2(3): 1688–1695 [Google Scholar]
- DAI H, AMICE A, WERNER P, et al. Certified polyhedral decompositions of collision-free configuration space[J]. Internati-onal Journal of Robotics Research, 2024, 43(9): 1322–1341. [Article] [Google Scholar]
- MARCUCCI T, NOBEL P, TEDRAKE R, et al. Fast path planning through large collections of safe boxes[J]. IEEE Trans on Robotics, 2024, 40: 3795–3811 [Google Scholar]
- CHEN K, LIU H, LI Y, et al. Robot navigation in unknown and cluttered workspace with dynamical system modulation in starshaped roadmap[C]//2025 IEEE International Conference on Robotics and Automation(ICRA 2025), Los Alamitos, 2025: 10140–10146. [Google Scholar]
- DING Derui, ZHANG Haohua, SUN Ran, et al. Map-free autonomous navigation and obstacle avoidance method of GRU-Attention-TD3 based on dual-branch perception fusion network[J/OL]. (2026-01-10)[2026-04-17]. [Article] (in Chinese) [Google Scholar]
- BOUHAMED O, GHAZZAI H, BESBES H, et al. Autonomous UAV navigation: a DDPG-based deep reinforcement learning approach[C]//2020 IEEE International Symposium on Circuits and Systems, Seville, 2020: 1–5. [Google Scholar]
- ZHAO W, QUERALTA J P, WESTERLUND T. Sim-to-real transfer in deep reinforcement learning for robotics: a survey[C]//2020 IEEE Symposium Series on Computational Intelligence, Canberra, 2020 [Google Scholar]
- LI G, SHI L, CHEN Y, et al. Breaking the sample complexity barrier to regret-optimal model-free reinforcement learning[J]. Information and Inference: A Journal of the IMA, 2023, 12(2): 969–1043. [Article] [Google Scholar]
- NIU H, JI Z, ARVIN F, et al. Accelerated sim-to-real deep reinforcement learning: learning collision avoidance from human player[C]//2021 IEEE/SICE International Symposium on System Integration, New York, 2021: 144–149. [Google Scholar]
- SHAO J Y, XIE G M, YU J Z, et al. Leader-following formation control of multiple mobile robots[C]//2005 IEEE International Symposium on Mediterrean Conference on Control and Automation Intelligent Control, Limassol, 2005: 808–813. [Google Scholar]
- BALCH T, ARKIN R C. Behavior-based formation control for multirobot teams[J]. IEEE Trans on Robotics & Automation, 1998, 14(6): 926–939 [Google Scholar]
- LI Zhengping, XIAN Bin. Robust distributed formation control of multiple unmanned aerial vehicles basedon virtual structure[J]. Control Theory & Applications, 2020, 37(11): 2423–2431 (in Chinese) [Google Scholar]
- FANG X, XIE L. Distributed formation maneuver control using complex laplacian[J]. IEEE Trans on Automatic Control, 2024, 69(3): 1850–1857. [Article] [Google Scholar]
- ZHAO S. Affine formation maneuver control of multiagent systems[J]. IEEE Trans on Automatic Control, 2018, 63(12): 4140–4155. [Article] [Google Scholar]
- HAN Z, WANG L, LIN Z, et al. Formation control with size scaling via a complex laplacian-based approach[J]. IEEE Trans on Cybernetics, 2016, 46(10): 2348–2359 [Google Scholar]
- LI H, CHEN H, WANG X. Affine formation tracking control of unmanned aerial vehicles[J]. Frontiers of Information Technology & Electronic Engineering, 2022, 23(6): 909–919 [Google Scholar]
All Tables
All Figures
![]() |
图1 仿射变换 |
| In the text | |
![]() |
图2 多无人机协同围捕的分层规划与控制 |
| In the text | |
![]() |
图3 动态滑动采样轨迹预测模型 |
| In the text | |
![]() |
图4 围捕点分配 |
| In the text | |
![]() |
图5 无障碍凸区域 |
| In the text | |
![]() |
图6 编队重构 |
| In the text | |
![]() |
图7 动作网络的结构 |
| In the text | |
![]() |
图8 评价网络的结构 |
| In the text | |
![]() |
图9 无人机在动态障碍环境中的围捕仿真结果 |
| In the text | |
![]() |
图10 标称编队及应力值 |
| In the text | |
![]() |
图11 局部动态避障路径 |
| In the text | |
![]() |
图12 围捕过程相关输出量 |
| In the text | |
Current usage metrics show cumulative count of Article Views (full-text article views including HTML views, PDF and ePub downloads, according to the available data) and Abstracts Views on Vision4Press platform.
Data correspond to usage on the plateform after 2015. The current usage metrics is available 48-96 hours after online publication and is updated daily on week days.
Initial download of the metrics may take a while.












