具有生物计量鉴别入侵和进入控制的系统及方法
【专利说明】具有生物计量鉴别入侵和进入控制的系统及方法
[0001]相关申请的交叉引用
[0002]本申请要求2014年2月28日提交的美国临时专利申请序列号61/946283的权益,其全部内容通过引用被合并于此,如同完全在此阐述。
技术领域
[0003]本发明一般涉及一种安全检测和控制系统,并且更具体地涉及一种系统和方法,其可以检测、处理并且响应于视觉和声响(audible)输入的结合。
【背景技术】
[0004]在物理安全领域,当进入受保护的住所、公寓或营业地点时,解除(disarm)报警系统通常包括用户键入预先指定的4位数的PIN码。不幸的是,这种常见的行为非常经常是错误报警以及客户受挫的来源,错误报警以及客户受挫源于输错PIN、在粘滞/间歇键座上的双键输入、或者在进入门口时拿不稳或掉落可能在手中的物品。使情况更糟糕是,用户可能在严格的时间压力下努力完成这个操作,以在预定的进入计时器(诸如例如30秒)期满以及向中心站呼叫报警之前停用报警系统。因此,在本领域中需要机会使解除报警过程更容易,压力更小,并且提供改进的用户体验一一通过仅允许被授权的个人解除所述系统而始终维护整个系统的安全。
[0005]所需要的是在门口的“好人/坏人检测器”的等同物,其可以有助于解除报警系统,同时维护正确的授权个人。这样的检测器(其可以是整个报警系统的一部分)应该通过使用个人独特的物理特性(基于生物计量学)而以理想的方式工作,不必持有可能丢失或被盗的“密钥卡”、进入卡或其他ID令牌。根据这样的检测,可以保持无手操作以允许携带物品或包裹,或者允许在寒冷的天气佩戴手套。将进一步有利的是,这样的进入和授权过程快速、方便以及不妨碍用户在门口的进入或外出。
[0006]附图的简要描述
[0007]图1是图示了根据本文所阐述的实施例的系统的示意图的框图。
[0008]图2是图示了根据本文所提出的实施例的第一方法的第一流程图。
[0009]图3是图示了根据本文所提出的实施例的另一方法的第二流程图。
【具体实施方式】
[0010]虽然本发明容许许多不同形式的实施例,但其以如下理解在附图中被示出并且将在本文对其具体实施例进行详细描述:本公开被认为是本发明原理的范例,而不是为了将本发明限制为所说明的具体实施例。
[0011]如本文所提出的,本发明的实施例涉及安全检测和控制系统及方法,其可以检测、处理并且响应于视觉和声响输入的结合。虽然这样的视觉和声响输入通常在本文中被描述为面部和语音识别特征,但是本领域普通技术人员将理解的是,本发明的实施例不限于此方面,并且可以不受限制地结合任何类型的视觉或声响输入检测一起使用。
[0012]本文中所述的实施例可以提供面部+语音生物计量融合鉴别,其可以作为这样的“好人/坏人检测器”。根据这样的实施例,在这样的系统中可以达到至少两个基本目标:
(I)通过符合公认的行业和监管标准而在适当授权或拒绝指定个人方面继续确保最高置信度,以及(2)通过向授权个人提供快速和方便的方式以解除报警系统并获得进入而保持积极的用户体验。
[0013]现在参照附图,图1图示了根据本文所提出实施例的示例性系统或设备10。所述设备10可以包括视觉输入装置12,诸如例如具有视野11的用于捕捉或记录视觉图像的摄像机或者其他装置。所述设备10可以进一步包括声响输入装置14,诸如例如用于捕捉视野11附近声音的传感器、检测器或麦克风。视觉和声响输入装置12、14可以位于入口通道附近,所述入口通道表征门(D)或其他类型的物理屏障,其可以在打开和关闭位置之间移动以允许或阻挡通过入口通道进入或离开。门(D)可以包括进入控制装置16,诸如例如机械、机电或磁性锁、阴极锁或电子控制器,其可以确保门(D)在关闭位置,以电子方式接合或分离进入控制装置16或者致动或控制门(D)或物理屏障打开或关闭。
[0014]视觉和声响输入装置12、14可以电耦合到监控系统18,监控系统18具有一个或多个控制电路和/或可编程处理器。监控系统18物理上可以位于本地或相对于视觉和声响输入装置12、14的远程位置,并且可以接收来自输入装置12、14的电子输入信号以及发送电子门控信号到进入控制装置16。所述监控系统18还可以耦合到一个或多个检测器22,所述检测器22位于整个建筑或设施的其他位置。
[0015]系统10还可以连接到手动可操作输入构件20 (例如,键盘),其可以允许用户装备(arm)或解除(disarm)监控系统18。其他电路也可以被提供并且耦合到控制电路,以评估声响或视觉指令中的至少一个从而装备或解除监控系统。
[0016]根据本文所提出的实施例,系统10可以包括面部识别处理路径(视频中心),语音识别处理路径(音频中心)以及融合计算器/决策装置。因此,监控系统18的控制电路可以响应于从输入装置12、14接收的视觉和声响输入两者而实现认证过程。
[0017]在执行这个认证过程中,控制电路可以接收和识别来自对象的语音命令以及对象面部特征的至少一个视觉图像,并且可以建立面部特征和语音命令的元素的评分。例如,来自视觉输入装置的电信号可以与来自声响输入装置的信号结合,以提供多方面的认证指示符,该认证指示符可以通过控制电路与预存规则集进行比较。在一个实施例中,例如,预存规则集可以是一组阈值。因此,控制电路可以结合来自输入装置12、14的电信号以登记授权的对象,并且生成对象相应的面部特征和语音元素的模板。
[0018]图2是图示了根据本文所提出的实施例的用于认证对象的示例性方法100的流程图。根据这样的方法100,系统可以响应于识别出预定类型的图像或接收到音频触发中的一个而启动用户认证过程的操作102。在认证对象时,系统可以在面部观察区域提供基本上恒定的照明度和/或从面部观察区域获得对象的图像序列104,以及使用所述序列检测面部形状106。同时,系统可以在可能利用背景噪声消除的情况下获得音频输入或信号103,例如来自对象的通行短语,以及可以处理音频输入以检测预定的音频特性105,从而创建说话人身份评分,说话人身份评分可以用于检测对象的身份。
[0019]系统还可以把来自所检测的面部形状的信息和来自对象的声响说话人身份评分相结合108,并且自动地确定相关的置信度评分110。根据本发明的实施例,置信度评分可以与预定阈值进行比较112。这种比较的结果是,可以关于允许进入、请求额外的确认(例如PIN输入)还是启动报警而进行确定114。
[0020]图3图示了根据本文所提出实施例的方法200的进一步细节。根据这个方法200,可以提供具有如下各项的检测器/传感器单元:用于捕捉图像的摄像机以及用于捕捉语音信号以供识别(文本相关或文本无关)的麦克风或声学换能器或传感器。授权的对象可以在系统中登记204,以生成对象面部特征和语音元素的模板。在认证对象时,可以捕捉对象面部特征的至少一个视觉图像以及来自对象的语音命令206,并且可以识别面部特征和语音命令的预定元素208。
[0021]在处理所捕捉到的输入时,可以建立所捕捉面部特征和语音命令的元素的评分210,以及基于最小和最大评分使该评分标准化212。基于面部和语音评分,可以表征面部和语音元素的质量214,并且可以从质量矩阵选择融合权重并且计算融合评分216。可以将融合评分与登记的授权对象的模板进行比较218。在检测到模板匹配的情况下,系统可以被解除武装220。相反,在没有检测到模板匹配的情况下,可以拒绝进入和/或生成报警222。
[0022]针对本文所提出类型的进入控制系统单元的会议行业公认的物理安全标准通过UL294 标准建立。UL294 要求 1/10000 的 FAR(0.01%差错)和 1/1000 的 FRR(0.1%差错)。满足这个要求可以通过采用面部识别评分和语音模式识别评分的结合融合而实现。目前最好的面部识别技术具有大约1%的差错率。目前最好的语音识别技术具有大约10%的差错率。然而,当结合基于置信度评分的面部匹配+语音匹配评分的融合时,已经确定的是可以实现安全行业所要求以及UL294中所述的期望的1/10
000的FAR和1/1000的FRR(99.99%的匹配置信度)。
[0023]通常,面部和语音认证的融合可以基于他们评分的自适应加权和,如下:
[0024]最终评分=wt (i) X面部评分+(1-wt⑴)X语音评分,
[0025]其中自适应权重wt(i)由评分的可信度确定。识别模态的评分范围可以被分组为多个区域。一个高度受信任区域,例如具有高评分,产生正确肯定的结果,另一个高度受信任区域,例如具有低的评分,产生正确否定的结果。一个低信任区域,例如具有中间的评分,通常产生错误拒绝和错误报警结果。因此,在一个模态中的具有低信任评分的不确定情况可以基于其他模态的评分来解决。因此,自适应权重可以从面部和语音评分的可信度和统计特性来获知。
[0026]面部和语音认证的结合可以基于面部和语音识别评分的融合。存在很多融合方法,例如两个评分的MIN,MAX, AND,OR以及SUM。他们往往在识别模态类似地执行的情况下运转良好。相反,面部和语音识别的性能在数量级上几乎不同。
[0027]通常,面部识别被发现是更可靠的并且其评分应该被更多地信任。因此,已经尝试了面部和语音评分的加权和。这种方法将固定权重应用到所有面部和语音评分,如下:
[0028]al score = wtX 面部评分 +(l_wt) X 语音评分,
[0029]其中wt是面部评分的权重并且通常接近1.0o这种方法忽略由于环境条件的变化而对性能的影响,并导致次优的性能。存在根据输入的质量调节权重的方法,使得inalscore = wt (i) X面部评分+ (l_wt (i)) X语音评分,其中wt(i)基于输入质量进行调节。不幸的是,输入质量的度量是不精确的,并且因此最终评分的性能仍不满足FAR、FRR要求。本发明的实施例还可以应用加权和方法以计算最终评分,如下:
[0030]最终评分=wt (i) X面部评分+ (1-wt (i)) X语音评分,其是基于评分的可信度的自适应权重。
[0031]评分可信度是一度量,其量度作为评分的函数的结果正确置信度。评分结果表明当评分高时,正确肯定的结果几乎是确定的,而当评分低时,正确否定的结果也是很确定的。当评分在中间范围时,错误拒绝和/或错误报警的发生变得频繁。因此,所述方法将评分范围映射到评分可信度的值,如下图所示。评分可信度可以是离散或连续的值。分区的数量还可以基于达到最佳性能所要求的保真度进行调节。
[0032]探测器上的面部识别过程可以计算面部评分和面部可信度评分。相同探测器上的语音识别过程可以类似地计算语音评分和语音可信度评分。然后自适应权重可以根据面部和语音评分可信度在融合公式中进行分配。
[0033]对于大的数据集,关于面部和语音评分的充分统计数值可以使获知和搜索算法能够将评分空间划分为评分价值的组,并且可以确定自适应权重以达到所要求的FAR和FRR。
[0034]如本文所述,如下装置和方法是新的和不同的:该装置和方法可以采用基于置信度评分的面部ID评分+语音ID评分的融合以装备或解除入侵检测报警系统。
[0035]此外,要相信的是,本文所述的实施例相对于其他已知方法是可区分的,并且提升了这样的面部+语音生物计量装备/解除系统的性能和操作,因为他们可以提供:
[0036]1.面部和语音输入两者的预调节,用于通过包含信号预调节后视频和音频信号捕捉来抵消操作环境的变化,以确保优质的面部和语音样本被比较;
[0037]2.噪声消除和背景声音减小,其利用连续背景声音监控通过使用选择性和审慎应用的频谱音频滤波来专注于人类语音信号和抑制环境噪声,而不会对区分语音的音质产生不利影响;
[0038]3.主动噪声消除(ANC)技术的采用,用于人类语音捕捉和环境噪声抑制,通过使用多个具有时间-相位负反馈噪声抑制的麦克风来保持准确的近场音频捕捉同时抑制背景噪声;以及
[0039]4.在融合计算之前对无意义的或高噪声语音音频样本的预筛选和拒绝。
[0040]通过其较高生物计量ID置信度的性质,根据本文所提出实施例的面部评分可以在整个融合计算中具有比语音评分更重的权重。没有进一步修正、高背景噪声、用户说出“无意义声音”或有人模仿别人的语音的情况下一一过度面部权重融合评分实际上仍可以在具有不合逻辑的语音(音频)输入的同时仅根据面部评分允许个人通过。虽然统计置信度在数学上被保持,但这样的行为可能降低这样的生物计量ID系统的感知置信度。为了减轻这种影响并且在融合计算之前,可以利用语音(音频)预鉴定步骤,该步骤确保仅对合逻辑的语音样本进行评分并且提交给融合计算。这可以在存在不合逻辑的音频输入的情况下确保合逻辑和可预见的安全行为。
[0041]5.动态获知和更新被登记者数据库用于长期性能增强以及连续识别被登记者的物理变化。
[0042]通过把已经确定为具有高捕捉质量和高匹配评分的最近匹配样本反馈到参考数据库中,可以使得生物计量匹配ID系统更适应于用户外表的长期变化(例如:衰老,发型,面部毛发,眼镜)。例如,针对该授权用户的数据库可以包含前三个匹配评分样本。这可以具有如下效果:显著提高认证性能,略微增加FAR性能。
[0043]6.每个被登记者可以具有他/她自己的通行短语,该通行短语可以选自建议库。
[0044]由于本文所提出的实施例可以将采样的通行短语和存储的参考相位进行比较,被登记者通行短语不必完全相同。事实上,用户ID短语对于给定的个人可以是唯一的,并且增强个人鉴别。
[0045]7.可执行命令(例如:“系统装备”或“系统解除”)的短语解释,通过除了语音模式匹配之外还采用共同地点语音命令识别以基于说出的命令影响预定的动作。
[0046]8.附近人类面部检测或语音触发短语,用于启动认证会话。
[0047]根据主题实施例,可以有至少两种方式来开始用户认证会话,从而使得系统不总是试图锁定随机视频和音频输入刺激。第一和默认方法可以是使设备总是打开并寻找和识别直接呈现在摄像机前方的人类面部。一旦检测到人类面部,认证会话就可以开始。第二方法可以采用语音触发短语来开始认证会话。该第二方法可以在使用之间节省更多的功率,但是可能要求用户首先提示系统开始。
[0048]9.提供对象面部的一致性照明度的主动照明(LED),而不管不同的环境照明条件如何,这通过不管环境照明条件如何而提供支持可见LED或近红外LED照明以确保一致性面部照明度来实现。
[0049]10.基于上下文和相邻的序列图像的人类现场检测。
[0050]现场检测防止任何使用照片和录制语音的欺骗和欺诈尝试。现场检测方法可以基于当探测器正说出通行短语时对所捕捉的图像序列的分析。在一个实施例中,这样的方法可以检测面部形状,并且提取序列图像的结构和面部关键点,例如嘴角。所述方法然后可以分析位置和运动的变化以及说话模式的相似度。此外,各帧之间的简单的帧差和面部关键点配准分析也可以提高现场检测性能。
[0051]这样的设备和方法可以包括面部识别处理路径(视频中心)、语音识别处理路径(音频中心)以及融合计算器/决策装置。所捕捉的面部和语音样本可以与本地被登记者生物计量数据库中预先登记的样本进行比较。所得的面部匹配评分以及语音匹配评分然后可以通过逆向加权(inversely weighted)方式结合,所述逆向加权方式的贡献系数(contribut1n coefficient)可以由相应的面部和语音匹配评分的质量(基于置信度评分的融合)来确定。整个所得匹配评分可以与阈值进行比较。具有超过阈值的匹配评分的用户可以被认证并且允许解除报警系统以及进入房屋。那些不满足认证阈值的用户可能被拒绝进入,并且报警请求可以生成到报警控制面板。
[0052]本文公开的实施例可以替代和/或增强住所或MDU/公寓内的传统报警键盘。例如,面部ID装置可以以大约头部高度(大约5.5英尺)被安装在正好住所主要入口内部的墙上。生物计量ID技术可以被嵌入在高端图形键盘内或作为分离的后继市场装置被靠近标准报警键盘安装。
[0053]在使用中,在系统识别出经鉴别的“好人”的情况下,在进入房屋时报警系统可以被
解除。“坏人”一一其不能被系统鉴别一一可以触发控制面板发出报警信号。在进入时,“好人”可以呈现他/她的面部并且说出命令,诸如例如“系统解除”,或作为备份方法而手动按下键盘上的“解除保持”键。在离开房屋时,“好人”可以向装置呈现他/她的面部并且说出命令,诸如例如“系统装备”,或作为备份方法而手动按下“装备离开”键。因此,如果对象想要被同意进入房屋,那么所述对象被期望是完全合作的。
[0054]面部ID装置还可以被编程或设计为在距对象的不同距离处检测对象的面部特性,包括例如,对象在ID装置的I到4英尺范围内的位置处。此外,在门口识别和处理对象的响应时间可以被设置或设计为I到2秒,该时间可以显著低于当前的键盘装备/解除方法(4位数字PIN+装备/解除)。
[0055]本文公开的系统和方法的性能水平可以满足规范的行业进入控制标准(例如UL294) 一一错误接受率(FAR)在1/10000的范围内或具有99.99%的置信度。此外,错误拒绝率(FRR)可以出现在1/1000的范围或99.9%的置信度。这样的性能水平,结合无与伦比的易用性,可以替代在报警键盘输入的现有的4位数PIN。
[0056]本发明的实施例还可以包括支持(一种或多种)协同验证技术,其提供额外的安全性而不妨碍用户进入/外出流程或者损害用户体验的乐趣。附加的好处是所述系统和方法提供“无手”操作,其在用户佩戴手套或携带包裹而经过门口时可能是非常有益的。虽然说话人依赖语音模式ID目前被视为是此时最适合的协同验证方法,但将被理解的是,在不偏离本发明新颖范围的情况下,本发明的实施例可以采用其他类似的语音识别方法。
[0057]用户生物计量数据提取和数据库匹配可以完全在装置内本地执行,或可以在远程位置执行;尽管基于在线(互联网/云)的处理或数据库搜索目前因为它要求多个外部附属物而是禁止的。然而,当这样的技术适应并改进时,其可以更有效地并入本文。此外,本文公开的实施例可以执行“选择列表”处理。例如,本地生物计量数据库可以被限制于那些有权不受约束进入特定住所或小型企业的人(被登记的人)一一这通常是12人或更少。没有登记在本地数据库中的其他每个人可以被视为潜在的入侵威胁,并且可能遭受生成报警。
[0058]本发明的面部ID PoC原型可以支持把新用户登记到本地数据库,这是灵活的并且最大化积极的用户体验一一也就是说这种原型可以最小化设备所要求的用户时间和物理交互。整个登记和批准过程可以使用本地处理资源来执行,该本地处理资源花费大约1-2分钟时间。此外,一旦达到本地用户数据库限制一一作为优选的故障机制,所述系统可以覆盖最早登记的用户。所述系统可以合并SNAP传感器摄像机和/或标准CMOS摄像机技术。
[0059]登记可以要求授权的发起人通过使用主用户PIN或使主用户向设备呈现其自身的预授权的面部+语音模式来批准后续的用户登记。为了简明和时间,登记和批准过程可以二者择一地默认为始终被授权。
[0060]系统特性和性能分析方法的其他示例可以包括,例如:
[0061].SWAP目标大约为:核心处理模块:<?6sq/in?(2”x3”),重量..< 4盎司,功率:< IW
[0062]?操作环境:受调节的室内环境(商业临时规范(temp spec))
[0063]?照明环境:期望的照明环境的宽变化,包括可能的强背光
[0064].ID 性能:UL294,99.99 % FAR,99.9 % FRR
[0065].ID响应时间:1-2秒,最大:< 3秒
[0066]?用户登记时间:1分钟之内,最大:2分钟之内
[0067]?输出:面部存在/不存在+匹配/不匹配
[0068]本发明的面部ID协议还可以结合各种其他技术一起执行,该各种其他技术包括智能电话、平板电脑、PDA以及具有视频捕捉驱动器的网络摄像机。这样的技术通常由生物计量程序良好地支持,提供最佳的用户反馈,提供丰富的⑶I环境,具有容易运送至所要求位置的独立演示平台,并且具有被良好支持的应用开发环境,该应用开发环境可以快速和高效地提供远程修补和更新。这样的技术还可以利用面部+语音认证应用或程序。
[0069]面部检测器还可以被转换为整数基检测器(integer base detector),其针对嵌入式系统可以是更快速的,并且玻璃检测器可以被提供用于改善质量和面部匹配。主题实施例可以进一步包括标志检测器以通过评估几个检测值而不仅评估最大检测值来更好地定位特定的面部标志。姿势估计器也可以被提供用于选择最佳的正面姿势或拒绝斜的姿势。
[0070]根据前面所述,将观察到的是,在不偏离本发明的精神和范围的情况下可以进行许多变化和修改。要理解的是,不意图或不应当推断出关于本文所示的具体设备的限制。当然,意图由所附权利要求覆盖落入权利要求的范围内的所有这样的修改。
[0071]此外,附图中所描绘的逻辑流程不要求所示的特定顺序或连续顺序来达到期望的结果。可以提供其他步骤到所述流程中,或可以从所述流程中去除步骤,并且可以添加其他部件到所述实施例,或者从所述实施例中移除部件。
【主权项】
1.一种设备,包括: 监控系统,其包括控制电路; 视觉输入装置,其耦合到所述控制电路;以及 声响输入装置,其耦合到所述控制电路,其中所述控制电路响应于视觉和听觉输入两者来实现认证过程。2.如权利要求1所述的设备,其中来自视觉输入装置的电信号与来自声响输入装置的信号结合以提供多方面的认证指示符。3.如权利要求2所述的设备,其中所述控制电路基于所述指示符与决策规则集的比较来确定可执行命令。4.如权利要求3所述的设备,其包括用于装备或解除所述监控系统的手动可操作输入构件。5.如权利要求4所述的设备,其包括耦合到所述控制电路的其他电路,用于评估声响或视觉指令中的至少一个来装备或解除所述监控系统。6.如权利要求2所述的设备,其中所述控制电路结合所述电信号以登记授权对象并且生成对象的相应面部特征和语音元素的模板。7.如权利要求6所述的设备,其中所述控制电路以渐进的方式更新所登记的授权对象的模板,以计及物理变化和背景变化。8.如权利要求6所述的设备,其中所述控制电路捕捉对象面部特征的至少一个视觉图像和来自所述对象的语音命令。9.如权利要求8所述的设备,其中所述控制电路识别所述对象的面部特征和语音命令的元素。10.如权利要求9所述的设备,其中所述控制电路建立针对面部特征和语音命令的元素的评分。11.一种认证对象的过程,包括: 响应于识别出预定类型的图像或接收到音频触发之一而启动用户认证过程的操作; 在面部观察区域提供基本上恒定的照明度; 从面部观察区域获得对象的图像序列; 使用所述序列检测面部形状; 获得来自对象的声响输入; 处理声响输入以鉴别说话人身份;以及 把来自所检测的面部形状的信息与说话人身份相结合,并且自动地确定相关联的置信度评分。12.如权利要求11所述的过程,其中结合信息基于规则集,所述规则集是面部和语音评分可信度的函数。13.如权利要求11所述的过程,其包括将置信度评分与预定的规则集进行比较。14.如权利要求13所述的过程,其中响应于比较的结果,确定是否如下之一:应该提供进入、应该要求来自对象另外的凭证、或者应该启动报警。15.如权利要求14所述的过程,其包括允许所述对象解除报警系统。
【专利摘要】一种具有生物计量鉴别入侵和进入控制的设备及方法。所述设备以监控系统、视觉输入装置和声响输入装置为特征。所述视觉和声响输入装置耦合到监控系统的控制电路,控制电路可以响应于视觉和听觉输入两者而实现认证过程。
【IPC分类】G07C9/00
【公开号】CN104881911
【申请号】CN201510172119
【发明人】S·J·豪, K·W·敖, S·文卡特沙, R·A·罗伊德, K·L·阿迪
【申请人】霍尼韦尔国际公司
【公开日】2015年9月2日
【申请日】2015年2月27日
【公告号】CA2882680A1, EP2913799A2, EP2913799A3, US20150248798
转载请注明原文地址:https://www.famiwei.com/read-8137638.html