一种基于语言交互的机械臂推抓协同操作系统及其控制方法

xiaoxiao2026-09-11  8


本发明涉及机械臂抓取控制,具体指一种基于语言交互的机械臂推抓协同操作系统及其控制方法。


背景技术:

1、机械臂智能抓取技术在家庭助理和服务机器人等领域备受关注,然而现有大多数机器人抓取技术主要适用于单个物体的抓取姿势检测,缺乏人机互动能力。在现实环境中,通过自然语言引导机器人理解和执行各种目标级抓取任务具有重要意义,例如从桌面上拿取特定的工具、整理物品或执行简单的装配工作。但是目前的技术无法适应多物体堆叠组成的复杂环境,这种情况下语言中的目标不可见。本发明提出了一种基于语言交互的机械臂推抓协同操作系统及其控制方法。该系统引入视觉接地来理解语言指令,并同时定位目标物体,通过推动将目标从复杂场景中分离出来,大大提升了杂乱环境中目标导向的抓取成功率,具有重要的理论价值和实际意义。


技术实现思路

1、本发明针对现有技术的不足,提出一种基于语言交互的机械臂推抓协同操作系统及其控制方法,基于目标掩膜的直线拟合抓取方法大幅提高了目标导向抓取的成功率。

2、为了解决上述技术问题,本发明的技术方案为:

3、一种基于语言交互的机械臂推抓协同操作系统,包括:

4、图像数据采集模块,用于采集工作区间的彩色图像irgb和深度图像idepth,其中在采集的数据利用realsense d435相机采集,采集的数据分辨率大小为640×480。对深度图进行归一化处理,将其数值范围缩放至0-255之间。相机被安装在机械臂的末端,自顶向下采集图像;

5、视觉语言定位模块,用于输入场景彩色图像irgb和自然语言描述l,利用视觉接地模型将图像和语言有效地映射到目标掩膜m上;

6、推动决策模块,用于输入场景彩色图像irgb和深度图像idepth,并缩放分辨率大小至224×224,利用dqn强化学习算法输出机械臂要执行的推动作;

7、抓动作预测模块,用于输入目标掩膜m,基于最小二乘法持续更新参数,得到拟合目标掩膜m的直线y,将直线和掩膜的信息特征融合表征物体分布,从而输出预测的机械臂抓取动作;

8、机械臂运动控制模块,用于接收算法输出的目标位置后规划出运动轨迹,进而输出控制信号;

9、机械臂抓取单元,用于接收控制信号按规划出的运动轨迹运动并进行物体的抓取或推动。

10、作为优选,所述图像数据采集模块还用于对采集的采集工作区间的彩色图像irgb和深度图像数据idepth进行预处理。

11、作为优选,所述机械臂抓取单元包括ur10六自由度机械臂、robotiq二指夹爪和末端力传感器。机械臂接收算法输出的目标位置后规划出运动轨迹,和二指夹爪共同完成物体的抓取或推动,末端力传感器用于测量控制二指夹爪闭合时的施加力度,以防止物体滑脱或产生形变。

12、本发明还提供了一种基于语言交互的机械臂推抓协同操作系统的控制方法,包括如下步骤:

13、步骤1、初始化机械臂,将其运动到起始位置;

14、步骤2、图像数据采集模块采集工作区间的彩色图像irgb和深度图像idepth并进行预处理,然后保存到本地;

15、步骤3、输入彩色图像irgb和自然语言描述l,利用referring transformer网络执行视觉接地任务,从而得到自然语言对应的目标掩膜m;

16、步骤4、根据目标掩膜m的形态完整性和周围空白区域的情况,判断抓取可行性;

17、步骤5、根据目标掩膜m以及抓取可行性的判断结果进行抓取预测;

18、步骤6、利用ros控制机械臂规划轨迹并执行,完成基于语言交互的杂乱环境下目标导向的抓取。

19、作为优选,所述referring transformer网络采用resnet101和bert大语言模型做主干网络。

20、作为优选,所述步骤3中,自然语言对应的目标掩膜m的获取方法为:

21、步骤3.1、分别通过resnet101和bert大语言模型提取图像和文本特征,并在文本特征基础上使用词性标注库提取目标名词短语特征,提取目标名词前后的一定数量的词汇的特征向量组成特定于短语的上下文信息;

22、步骤3.2、提取图像和文本特征经过视觉语言编码器融合后得到视觉语言多模态特征;

23、步骤3.3、用短语特征和特定于短语的上下文信息经过线性层后投影得到的向量做参考查询;

24、步骤3.4、将参考查询和视觉语言多模态特征融合输入到分割任务头上,并跳跃连接resnet101不同阶段的特征以获取全局和局部信息;

25、步骤3.5、最后将上采样后的特征映射转化为单通道热图,从而得到自然语言对应的目标掩膜m。

26、作为优选,所述步骤4中,通过目标掩膜m的完整性以及周围是否存在可供夹爪伸入的空白区域判断抓取的可行性。

27、作为优选,所述步骤5中,基于掩膜的抓取预测,经过推动后目标掩膜清晰可见且物体周围留有空白区域,满足抓取条件。采用图像处理技术和直线拟合法预测掩膜m上的抓取像素点位置(xg,yg)和抓取角度θg。包括掩膜的数据处理、直线拟合的参数更新和抓取信息的提取。具体方法为:

28、首先,使用中值滤波消除原始掩膜数据中的高斯噪声和误差数据,保留物体的边缘信息并检测其轮廓c做样本点集用于直线拟合,随机初始化直线y=kx+b,k和b为直线的斜率和截距;

29、轮廓由一系列像素点组成,提供了物体外部边缘的形状大小和方向等信息。将轮廓c作为样本点集能有效反映物体分布整体趋势,同时数据规模小方便计算。将轮廓c作为样本点集,不断遍历样本集上的数据点,计算均方差表示样本集和目标直线中的误差系数,循环迭代更新参数,最终样本点与拟合直线之间的距离最小化,从而确定k和b,

30、

31、其中t表示残差平方和下的目标函数,(xi,yi)表示轮廓c上的第i个样本数据;

32、最后,计算直线和掩膜的交点(x1,y1)...(xj,yj)...(xm,ym),计算公式如下:

33、

34、θ=arctan(k)/π×180

35、求平均值作为最终的抓取像素点位置(xg,yg),直线拟合了物体的分布趋势,其斜率的反正切值(转为角度制)作为抓取角度θg。

36、作为优选,所述步骤5中,抓取可行性判断不满足抓取条件,将彩色图像irgb和深度图像idepth作为输入,通过基于深度强化学习的推动作神经网络强化学习动作决策,其中,基于深度强化学习的推动作神经网络包括:多模态信息融合层、特征提取层和上采样层,特征提取层由batch normalization(批归一化层)、rectified linear unit(线性激活层)和convolutional 2d(二维卷积层)组成。

37、作为优选,所述强化学习的方法为:

38、将彩色图像irgb和深度图像idepth经过imagenet预训练的densenet-121网络的卷积层部分进行特征提取,得到彩色特征图irgb_feat和深度特征图idepth_feat后沿通道拼接得到融合特征图ifusion_feat;

39、ifusion_feat经过两次卷积单元后上采样还原回224×224分辨率大小,得到网络预测图q(st,a;θ*),其中θ*表示网络参数,a表示推动作的动作空间;将彩色图irgb和深度图idepth记为st,作为状态空间,其中t表示当前时刻。

40、224×224分辨率大小的网络预测图q(st,a;θ*)构成了庞大的动作集合,增加了网络的复杂性和训练难度。在深度图上做阈值处理实现对前景信息的提取和分割,事实上网络只需关注物体周边区域。为了减少大量空白背景处的无效探索,采用目标轮廓作为有效先验约束动作空间。从深度图idepth中边缘检测、二值化处理得到只在物体轮廓处有单位值的轮廓图ioutline,将网络预测图q(st,a;θ*)与轮廓图ioutline通道相乘操作,ioutline上空白背景处的值为零,最终只在物体轮廓处有预测值;

41、将预测值上沿每个通道argmax操作并比较,从而得到最大动作预测值at,即推动像素点位置(xp,yp)和推动角度θp。

42、作为优选,所述步骤6的具体方法为:

43、预测的抓取/推动像素点动作信息(xpix,ypix,θ),结合深度图idepth和相机成像原理得到相机坐标系下的三维坐标(xcam,ycam,zcam),通过手眼标定得到真实世界下的坐标(xworld,yworld,zworld),借助ros的服务通信发送到moveit对机械臂运动的路径进行规划,最后控制夹爪的开闭实现推抓协同。

44、作为优选,通过计算得到所述三维坐标(xcam,ycam,zcam),表达式如下:

45、

46、其中(fx,fy)和(cx,cy)代表相机内参中的焦距和中心像素坐标。

47、作为优选,通过手眼标定得到真实世界下的坐标(xworld,yworld,zworld),表达式如下:

48、

49、代表手眼标定后得到的旋转和平移变换矩阵,01×3表示一行三列的零向量。

50、本发明具有以下的特点和有益效果:

51、采用上述技术方案,本发明利用视觉接地技术来解析自然语言以定位目标物体,并采用深度强化学习方法指导智能体学习自主推动技能。通过基于轮廓的动作空间先验约束,有效降低了无效探索的试错成本,显著提升了训练效率,使得网络能够在复杂堆叠环境下专注于紧密区域执行推动动作。此外,基于目标掩膜的直线拟合抓取方法大幅提高了目标导向抓取的成功率。系统采用模块化设计,结构层次清晰,具备重要的理论价值和实际意义。


技术特征:

1.一种基于语言交互的机械臂推抓协同操作系统,其特征在于,包括:

2.根据权利要求1所述的一种基于语言交互的机械臂推抓协同操作系统,其特征在于,所述图像数据采集模块还用于对采集的采集工作区间的彩色图像irgb和深度图像数据idepth进行预处理。

3.根据权利要求1所述的一种基于语言交互的机械臂推抓协同操作系统,其特征在于,所述机械臂抓取单元包括ur10六自由度机械臂、robotiq二指夹爪和末端力传感器。

4.根据权利要求1所述一种基于语言交互的机械臂推抓协同操作系统的控制方法,其特征在于,包括如下步骤:

5.根据权利要求4所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述referring transformer网络采用resnet101和bert大语言模型做主干网络。

6.根据权利要求5所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述步骤3中,自然语言对应的目标掩膜m的获取方法为:

7.根据权利要求4所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述步骤4中,通过目标掩膜m的完整性以及周围是否存在可供夹爪伸入的空白区域判断抓取的可行性。

8.根据权利要求4所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述步骤5中,抓取可行性判断满足抓取条件,抓取预测的方法为:

9.根据权利要求4所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述步骤5中,抓取可行性判断不满足抓取条件,将彩色图像irgb和深度图像idepth作为输入,通过基于深度强化学习的推动作神经网络强化学习动作决策。

10.根据权利要求9所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述强化学习的方法为:

11.根据权利要求8-10任意一项所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,所述步骤6的具体方法为:

12.根据权利要求11所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,通过计算得到所述三维坐标(xcam,ycam,zcam),表达式如下:

13.根据权利要求11所述的一种基于语言交互的机械臂推抓协同操作系统控制方法,其特征在于,通过手眼标定得到真实世界下的坐标(xworld,yworld,zworld),表达式如下:


技术总结
本发明公开了一种基于语言交互的机械臂推抓协同操作系统,包括:图像数据采集模块,用于采集工作区间的彩色图像I<subgt;rgb</subgt;和深度图像I<subgt;depth</subgt;;视觉语言定位模块,用于输入场景彩色图像I<subgt;rgb</subgt;和自然语言描述L,将图像和语言有效地映射到目标掩膜M上;推动决策模块,用于输入场景彩色图像I<subgt;rgb</subgt;和深度图像I<subgt;depth</subgt;,利用DQN强化学习算法输出机械臂要执行的推动作;抓动作预测模块,用于输入目标掩膜M,从而输出预测的机械臂抓取动作;机械臂运动控制模块,用于接收算法输出的目标位置后规划出运动轨迹,进而输出控制信号;机械臂抓取单元,用于接收控制信号按规划出的运动轨迹运动并进行物体的抓取或推动。该系统基于目标掩膜的直线拟合抓取方法大幅提高了目标导向抓取的成功率。

技术研发人员:杨宇翔,郭江涛,李子龙,何志伟,黄继业,李平
受保护的技术使用者:杭州电子科技大学
技术研发日:
技术公布日:2024/9/23
转载请注明原文地址:https://www.famiwei.com/read-9027190.html

最新回复(0)