基于深度强化学习的多水面自主航行器编队航行决策方法

xiaoxiao2026-09-30  6


本发明涉及无人船编队,尤其涉及一种基于深度强化学习的多水面自主航行器编队航行决策方法。


背景技术:

1、随着海上战略资源的不断开发,海上作战、海上搜救、海上护航等基于船舶编队的研究备受关注。在海上作战任务中,航母编队集群通过编队间的通信与协作共同完成复杂战略任务,从而提高了整体作战安全性。这种能力通常比单个舰艇更为突出。此外,多智能体系统在卫星通讯、网络安全、无人机协同控制等不同领域发挥出色的性能为船舶编队的研究提供了新的解决方案。

2、在现有的研究中,已存在一些较为成熟的编队策略,其中包括给予策略行为的控制、虚拟结构策略以及领航者-跟随者结构策略。其中,领航者-跟随者作为目前最为常用的一种编队控制方法,其基本思想是:所有编队成员被指定为领航者或跟随者这两种角色。领航者通过沿着预定或者临时设定的路径航行,掌控编队的运动趋势,跟随者依据相对于领航者的距离及方位信息跟随领航者实现编队控制。虚拟结构策略将编队的所有成员视作一个整体进行处理。该方法需要确定虚拟结构的运动学和动力学特性,然后推导出虚拟结构上虚拟目标点的相应特性。通过控制器使机器人跟踪对应虚拟目标点,实现编队控制。虽然上述方法在研究中取得了一系列成果,但面对于处理未知环境中动态避障问题依旧显得束手无策。单纯采用传统控制编队方法对于多智能体协同避碰决策存在一定的局限性;传统的领航者-跟随者方法虽然控制结构简单,易于实现,且跟随者以预定的位置偏移跟随领航者即可实现编队控制,但是该方法过度依赖领航者的决策能力;虚拟结构策略需要编队成员一直保持同一个刚性结构,缺乏灵活性和适应性。另外,严格的队形约束会诱发频繁控制指令,增加能耗,甚至出现执行器饱和现象。


技术实现思路

1、本发明公开了一种基于深度强化学习的多水面自主航行器编队航行决策方法,以克服上述技术问题。

2、为了实现上述目的,本发明的技术方案是:

3、一种基于深度强化学习的多水面自主航行器编队航行决策方法,包括如下步骤:

4、s1:建立船舶运动模型,以构建多水面自主航行器编队模型,获取跟随者编队距离误差;

5、s2:建立基于领航者策略网络的领航者奖励函数,以获取领航者的总奖励值;根据所述跟随者编队误差,建立基于跟随者策略网络的考虑跟随者与障碍物间的距离的跟随者的奖励函数,以获取跟随者的总奖励值;

6、s3:根据所述领航者的总奖励值、领航者策略网络,获取领航者的舵角、领航者的速度;

7、s4:根据全球导航卫星系统和所述多水面自主航行器编队模型,获取领航者的预测位置坐标;

8、s5:根据所述领航者的预测位置坐标、跟随者的总奖励值和跟随者策略网络,获取跟随者的舵角和跟随者的速度;

9、s6:根据所述跟随者的舵角、跟随者的速度、领航者的舵角和领航者的速度,对水面自主航行器编队航行进行控制。

10、进一步的,所述跟随者奖励函数包括编队误差奖励、速度奖励和避碰奖励;

11、所述编队误差奖励获取如下:

12、

13、其中,表示编队误差奖励;权重参数;ef表示跟随者编队误差;为可包容误差界限;为最大误差界限;表示跟随者与障碍物间最小距离;s2表示危险距离;

14、所述速度奖励获取如下:

15、

16、其中,表示速度奖励;为速度包容界限,为最大速度界限,表示速度包容界限奖励权重;表示最大速度界限奖励权重;表示跟随者与障碍物间的距离;表示偏好速度;v表示跟随者当前速度;

17、所述避碰奖励获取如下:

18、

19、其中,表示避碰奖励;表示避碰奖励权重;

20、所述跟随者的总奖励值获取如下:

21、

22、式中:rf表示跟随者的总奖励值。

23、进一步的,所述船舶运动模型建立如下:

24、

25、其中,表示船舶位置坐标与航向角组成的向量;r(ψ)表示船舶的旋转矩阵;ψ表示船舶艏向角;v表示船舶运动速度矢量;m表示系统惯性矩阵;表示船舶横移速度;c(v)表示向心矩阵和流体动力学矩阵之和;d(v)表示非线性阻尼矩阵;g(v)表示未建模的动力学模型;τ表示推进前进力;τw表示环境干扰外力的总和。

26、进一步的,所述跟随者编队距离误差获取方法如下:

27、

28、其中,表示水面自主航行器编队中跟随者的位置横坐标;表示水面自主航行器编队中跟随者的位置纵坐标;θ0表示误差偏差角度;dn表示跟随者误差系数;θ′表示相对角度;θ0表示误差偏差角度;表示虚拟领航者真实位置横坐标;表示虚拟领航者真实位置纵坐标;表示微分增量;θn表示跟随者与虚拟领航者构成稳定编队队形后的角度差;

29、

30、式中:ef表示跟随者编队误差;n为跟随者的索引编号,n为跟随者的总数;表示跟随者的预计到达位置的横坐标;表示跟随者的真实位置的横坐标;表示跟随者的预计到达位置的纵坐标;表示跟随者的真实位置的纵坐标。

31、进一步的,所述领航者奖励函数包括制导奖励、安全奖励、偏航角修正奖励和碰撞奖励;

32、其中,所述安全奖励获取如下:

33、

34、其中,rs表示安全奖励;λs表示安全奖励的权重,rradar表示雷达探测半径,s1表示安全距离,rt表示虚拟领航者与障碍物间的距离,σ1表示偏航奖励值。

35、进一步的,所述制导奖励获取如下:

36、

37、其中,rd表示制导奖励;λd表示制导奖励权重,表示虚拟领航者真实位置横坐标;表示虚拟领航者真实位置纵坐标;xd,yd分别表示目的地位置的横坐标和纵坐标;

38、所述偏航角修正奖励获取如下:

39、

40、其中,ryaw表示偏航角修正奖励;yaw是偏航角度,tr是误差系数,λy是偏航角度奖励的权重参数,ε是距离变化参数;

41、所述碰撞奖励获取如下:

42、

43、式中:rc表示碰撞奖励;collision表示发生碰撞;goal表示到达目标位置;

44、进一步的,所述领航者的总奖励值获取如下:

45、r=rd+rs+ryaw+rc

46、式中:r表示领航者的总奖励值。

47、有益效果:

48、本发明的一种基于深度强化学习的多水面自主航行器编队航行决策方法,分别建立了领航者奖励函数以及基于考虑跟随者与障碍物间的距离的跟随者的奖励函数;进而根据所述领航者的总奖励值、领航者策略网络能够获取领航者的舵角、领航者的速度;同时根据有全球导航卫星系统和所述多水面自主航行器编队模型所获取的领航者的预测位置坐标,结合跟随者的总奖励值和跟随者策略网络,获取跟随者的舵角和跟随者的速度;最后通过跟随者的舵角、跟随者的速度、领航者的舵角和领航者的速度,实现对水面自主航行器编队航行进行控制。本发明根据虚拟领航者预计到达位置的坐标,来约束跟随者需要承担队形保持的任务执行,对领航者决策的依赖性较低,跟随者进行编队时的灵活性和适应性较强。并且基于领航者的控制指令较少,执行器的执行能耗大大降低,避免了出现执行器饱和的现象。


技术特征:

1.一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,包括如下步骤:

2.根据权利要求1所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,所述跟随者奖励函数包括编队误差奖励、速度奖励和避碰奖励;

3.根据权利要求1所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,所述船舶运动模型建立如下:

4.根据权利要求1所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,所述跟随者编队距离误差获取方法如下:

5.根据权利要求1所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,所述领航者奖励函数包括制导奖励、安全奖励、偏航角修正奖励和碰撞奖励;

6.根据权利要求5所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,所述制导奖励获取如下:

7.根据权利要求1所述的一种基于深度强化学习的多水面自主航行器编队航行决策方法,其特征在于,


技术总结
本发明公开一种基于深度强化学习的多水面自主航行器编队航行决策方法,分别建立了领航者奖励函数以及基于考虑跟随者与障碍物间的距离的跟随者的奖励函数;进而根据所述领航者的总奖励值、领航者策略网络能够获取领航者的舵角、领航者的速度;同时根据有全球导航卫星系统和所述多水面自主航行器编队模型所获取的领航者的预测位置坐标,结合跟随者的总奖励值和跟随者策略网络,获取跟随者的舵角和跟随者的速度;最后通过跟随者的舵角、跟随者的速度、领航者的舵角和领航者的速度,实现对水面自主航行器编队航行进行控制。本发明根据虚拟领航者预计到达位置的坐标,来约束跟随者需要承担队形保持的任务执行,对领航者决策的依赖性较低,跟随者进行编队时的灵活性和适应性较强。并且基于领航者的控制指令较少,执行器的执行能耗大大降低,避免了出现执行器饱和的现象。

技术研发人员:关巍,崔哲闻,张显库,张国庆,郝淑慧,孙帅
受保护的技术使用者:大连海事大学
技术研发日:
技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9027993.html

最新回复(0)