为啥手机siri谁都可以喊出来,siri 唤醒词 个性化 训练

题图来自Unsplash,基于CC0协议
导读
苹果甚至没有给中文版Siri设计专属唤醒词,整套系统里只认一句「嘿Siri」,这便是iPhone从诞生开始就是极具代表性的开放性案例,很大程度上开创流式语音交互的先河。但这种共享唤醒词机制从未停止争议,特别是这两年深度求索、美图等公司模仿这个需求推出语音助手,更是证明「唤醒指令」具备极高的模仿性和普适性,现实生活也诞生许多惹禢新闻。
语音识别原理与声音的安全机制
Siri早先是通过云端进行语言模型,采用模煳唤醒方式,在你用指定唤醒词召Siri后,它再以一定准确率确认你正在说指令,从而避免误唤醒带来的隐私泄露风险。苹果独创的就是声未断网先接,在整个唤醒词识别阶段,它会限定只能匹配预设好短语「嘿Siri」,一旦调用则自动切换到更高权限的云端进行语音解析,而不是人人可齐声喊麦。但像智能家居设备等第三方付出,却是不同程度牺牲唤醒准确率来确保性价比,比如常用喊麦词「天猫精灵」,实际属于系统关键词库中的部分字元,客观上也为误唤醒打开了通道。
谁都可以唤醒 Siri的风险
就初级谣言收到「iPhone会监听你」这个误区便众所周知,更确凿事实发生在格鲁吉亚一户家庭,为防止孩子吵闹,父母设置自动发送居家照片至手机,结果那一晚孩子玩闹连续触发Siri发送百张自拍照,源于唤醒词「Hey Siri」被类似外国人的指令口误激活。更典型是某位父亲带入厨房准备炸鸡,误把「播放炸弹」说成热词「Hey Siri」加关键数字,触发向对方发射一枚假炸弹模拟的回答,这便造成系统不怕陌生人唤醒的争议点。
除模拟词外,张口说「Hey Siri」多大年龄最容易召唤声控呢?检测表明,原本触发需要带上口音等,但若语音音量达到一定dB值,即便是在闹市里也能正常召唤助理,甚至隔着衣服、带着耳麦等也能成功唤醒,所以确实存在位置不限制、信号不受限的隐患。 解决方案
假如你受够这种尴尬,其实能大幅度提升音量长度。比如打开iPhone控制中心,往麦克风「风车」符号轻点几下就能设置更低的麦克风灵敏度,于是在会议室、健身房、风雨天等也能安心说话被识别,但醒来会偷听?不会哟因为对方喊开麦的条件必须再升级。还有一种方式是往快捷指令中录入自己说出关键词句,让Siri人为前置握手条件。选择编程模式还能定制逻辑,比如在特定APP后台或时段才允许触发Siri,这属于一种更严格式的主动锁定。
苹果也察觉唤醒率太高的弊病,很多人抱怨「只要你敢在客厅说嘿Siri就会被系统拉起」,主要因为字库词汇多达数万千,硬件端查找系统词汇运算量大,必须将模型进行云端解压。但软硬件同步调教下,时值唤醒机制确实发生天翻地覆改变。过去苹果采用的是「一响一照」式调优,在SpUR项目中往往需要搭配长按电源键说出指令,而且就近新设备如iPadOS已移除响应设定,从物理上阻止距离因素引发误唤醒。
就连能否用方言/外语触发,也是涉及到苹果在设计不同国家应用时,有必要适配当地的唤醒词与语音规则,即便符合要求,也可能因设备内存占用过高限制使用哪些词库。即使你成功让自己声音训练成特定角色从而风骚一把,但事实上Siri也并非引入声纹锁,所谓开启特定语音可能是靠手机历史记录进行分析,到底听不听话还得是DeepL,但混合你每次回应的语谱与关键词数据库识别度,通常是真正的判别支点。
总之iPhone所打造的语音唤醒机制,在兼顾会话规范的基础上,展现了极高劝化开放性的设计初衷,尤其对于提升使用手感堪称一创之举,但始终不可能做到严防死守别人谁都可以喊出来的魔性程度。苹果也不时进行技术迭代,允许用户在训练自己的声音的情况下,逐步封堵那些最灵活模仿玩法的近距威胁。
值得一提的是,所谓多设备流畅唤醒,现在其实完全是软件层面带来的,无声唤醒模式也是需要硬件支持与能耗的互相配合。所以综观全局,Siri到底是开放趁早,还是谨言慎行的产物,本质上取决于你把用户体验和安全检查放在位子位置,从苹果意图来说,似乎还是走了温柔的路。
© 版权声明
本文由盾科技原创,版权归 盾科技所有,未经允许禁止任何形式的转载。转载请联系candieraddenipc92@gmail.com