俄科学家提升人工智能合成语音听感
日前,圣彼得堡国立大学研究团队将语调模型集成至神经网络,使人工智能合成语音的听感更自然、更贴近真人。这一进展有望优化语音助手、人形机器人等设备所使用的文本转语音系统。 现有语音合成模型往往倾向于生成最常见的单词发音或短语发音变体,难以生成能够传达语义与情感细微差别的语调。同时,若句子各部分的语调组合不当,即便音质生成质量较高,也会影响整体听感。圣彼得堡国立大学的语言学家致力于弥补神经网络的这一短板,其提出的改进方案有效改善了语调不自然、单调的问题。 模型训练依托圣彼得堡国立大学语音学与外语教学方法系开发的语调分类体系,该体系由该系副教授妮娜・沃尔斯卡娅与系主任帕维尔・斯克雷林教授共同构建。这一分类体系涵盖疑问句、陈述句、祈使句、请求句、呼语句等多种句类,并包含多种音高模式变体。 圣彼得堡国立大学副教授乌里亚娜・科切特科娃解释称,得益于合理的数据结构与对音高变化的精准标注,模型能够传达丰富的语调细节,从而生成更自然、更具......阅读全文
俄科学家提升人工智能合成语音听感
日前,圣彼得堡国立大学研究团队将语调模型集成至神经网络,使人工智能合成语音的听感更自然、更贴近真人。这一进展有望优化语音助手、人形机器人等设备所使用的文本转语音系统。 现有语音合成模型往往倾向于生成最常见的单词发音或短语发音变体,难以生成能够传达语义与情感细微差别的语调。同时,若句子各部分的语
模仿原声:迄今最复杂人工智能语音模型创建
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/503513.shtm Meta称研制出迄今最复杂人工智能语音模型。图片来源:英国《每日邮报》网站科技日报北京6月25日电 (记者刘霞)据英国《每日邮报》23日报道,脸书母公司元宇宙平台公司(Met
人工智能将喉部肌肉运动转为语音,能准确翻译“我爱你”
《自然·通讯》14日发表的一篇论文描述了一种能在机器学习辅助下,将喉部肌肉运动转化为语音的柔性贴片。经过进一步开发,该装置有望帮助部分嗓音障碍患者有效沟通。 研究中贴片的工作示意图。 图片来自:陈俊/《自然·通讯》 说话是人际交往的重要部分,但对于有声带功能障碍的人来说是件难事。约有30%
守护风景线-筑绿不动摇——3月草原听“三感”
“生态确实是内蒙古最大、最丰富的资源”“建设生态安全屏障就是要贡献更多的绿水青山,保卫北京,保卫‘三北’,保卫全中国”“贯彻两会精神要抓紧对标对表,切实解决‘一湖两海’等突出环境问题”…… 3月的内蒙古大地乍暖还寒,走访一些旗县,干部群众说起生态建设时表达出的自豪感、责任感、紧迫感却似阵阵热流
语音报警验电器
描述伸缩型语音报警验电器主要技术指标产品规格:10KV、35KV、110KV、220KV、500KV注:可根据用户需求定做。序号项目验电器类别参数10KV35KV110KV220KV500KV1缩态长度mm38048058078016002伸态长度mm100015002000310072003有效绝
ChatGPT将变身AI语音助手?挑战Siri和谷歌语音助手
新品发布在即,奥特曼的最新表态或暗示OpenAI意在人工智能语音助手。当地时间5月11日,人工智能(AI)巨头OpenAI CEO山姆·奥特曼(Sam Altman)在一档播客节目中称,OpenAI将继续改进并提升ChatGPT的语音功能质量,并表示相信语音交互是通向未来交互方式的一个重要途径。奥特
大模型为深度伪造带来土壤,鉴伪技术需要跨学科合作
·鉴伪技术开发需要跨学科合作,当前的鉴伪技术以软件算法为主,未来将走向软硬一体。大模型兴起为深度伪造带来土壤,业界呼吁跨学科联合攻坚鉴伪技术。在大模型时代,人工智能合成语音与真实语音之间的界限变得越发模糊,提升与之匹配的识别技术迫在眉睫。7月23日,主题为语音深度鉴伪识别的第九届信也科技杯全球人工智
听漏仪简介
听漏仪也称地面听漏仪,主要由拾音器、信号处理器和耳机三部分组成。其工作原理是利用地面拾音器收集漏声引起的震动信号,并把震动信号转变为电信号转送到信号处理器,进行放大、过滤等处理;最后把音频信号送到耳机,把图形、波形或数字等视频信号显示在显示屏上,帮助确定漏水点。电子听漏仪主要用于漏水点的精确定位
听地下虫子的话
尽管可能没有黎明时分鸟儿合唱那样的吸引力,但地下的蚂蚁、甲虫幼虫和蠕虫的声音可以提供一张生态系统是否健康的“快照”。相关论文8月15日发表于《应用生态学杂志》。论文作者、澳大利亚弗林德斯大学的Jake Robinson说:“我们的想法是,可以通过无脊椎动物发出的声音监测土壤的健康状况。”蚯蚓等生物在
语音识别技术分析:语音变成文字其实没有那么神秘2
那每帧音素对应哪个状态呢?有个容易想到的办法,看某帧对应哪个状态的概率最大,那这帧就属于哪个状态。比如下面的示意图,这帧对应 S3 状态的概率最大,因此就让这帧属于 S3 状态。 那这些用到的概率从哪里读取呢?有个叫“声学模型”的东西,里面存了一大堆参数,通过这些参数,就可以知道帧和状态对应的
语音识别技术分析:语音变成文字其实没有那么神秘1
简要给大家介绍一下语音怎么变文字的吧。希望这个介绍能让所有同学看懂。 首先,我们知道声音实际上是一种波。常见的 mp3、wmv 等格式都是压缩格式,必须转成非压缩的纯波形文件来处理,比如 Windows PCM 文件,也就是俗称的 wav 文件。wav 文件里存储的除了一个文件
计算机学会像人脑一样“听话”了
在通勤的地铁上、嘈杂的餐厅里,广播声、音乐声、周围人说话声,似乎都不会妨碍你与同伴进行交流。而这,就是大脑在处理声音信息时发挥的特殊优势——它可以将注意力集中在感兴趣的对话或声音上,忽略其他无关的声音或者噪音。其实,早在70多年前,神经科学家就注意到大脑的这种神奇能力,并将其称为“鸡尾酒会效应”。“
当心陷入深度伪造语音陷阱
原文地址:http://news.sciencenet.cn/htmlnews/2023/8/505961.shtm
电测听的简介
电测听是利用现代电子技术记录因声音刺激而在听觉系统诱发的电位变化的方法。由于近代听觉电生理学及电子计算机技术的发展,使诱发出的微弱电反应能清楚显示,以客观评价听觉系统的功能状态。适用于婴幼儿及不能配合检查的成年人的听阈测定、功能性聋与与器质性聋的鉴别、耳蜗及蜗后病变的鉴别、听神经瘤及某些中枢病变
水听器的定义
将声信号转换成电信号的换能器,用来接收水中的声信号,称为接收换能器,也常称为水听器。水听器广泛用于水中通信、探洲、目标定位、跟踪等,是声纳的重要部件,水下的探测、识别、通信,以及海洋环境监侧和海洋资源的开发,都离不开水声换能器。
光纤水听器简介
光纤水听器是利用光纤技术探测水下声波的器件,它与传统的压电水听器相比,具有极高的灵敏度、足够大的动态范围、本质的抗电磁干扰能力、无阻抗匹配要求、系统“湿端”质量轻和结构的任意性等优势,因此,足以应付来自潜艇静噪技术不断提高的挑战,适应了各发达国家反潜战略的要求,被视为国防技术重点开发项目之一。
听,流星划过的声音
你听过流星划过的声音吗?这像是个愚蠢的问题。但事实上,流星在大气层燃烧时确实会制造出声音,这声音可能像树叶沙沙作响,也可能如同人们窃窃私语。只不过,这些声音并不是流星摩擦大气的声音,而是由流星燃烧时发出的强光制造的。 美国新墨西哥州圣地亚国家实验室的研究人员在发表于《科学报告》杂志上的文章中作
电子听漏仪简介
电子听漏仪(即听漏仪)是一种利用漏水噪音原理工作的仪器。自来水管道发生破裂漏水时会发出噪音传向四方,常用的检漏仪由传感器和放大器组成,通过地面听音的方法判断漏水点位置,探头的核心是高灵敏度声音传感器,能将微弱的声音转换成电信号。
水听器的分类
根据作用原理、换能原理、特性及构造等的不同,有声压、振速、无向、指向、压电、磁致伸缩、电动(动圈)等水听器之分。水听器与传声器在原理、性能上有很多相似之处,但由于传声媒质的区别,水听器必须有坚固的水密结构,且须采用抗腐蚀材料的不透水电缆等。 声压水听器探测水下声信号以及噪声声压变化并产生和声压
矢量水听器简介
矢量水听器是接收换能器的一种。在国外,矢量水听器是继标量水听器后的热门研究课题。矢量水听器的研制工作最早始于20世纪40年代的美国,以美国学者50年代发表的有关使用惯性传感器直接测量水中质点振速的经典论文为标志,后来,相继在苏联、英国、日本、法国逐步开展这方面的研究工作。
关于耳听评价腭咽闭合不全的介绍
耳听评价是临床中最常用、最简单以及最重要的评价方法,绝大部分的语音异常都能通过耳听评价来进行诊断。耳听评价腭咽闭合不全引起的语音异常主要为:过高鼻音、鼻漏气、口腔压力减弱和代偿性发音,前三种异常直接由解剖结构异常引起为一类发音错误,而代偿性发音则是间接由解剖结构异常引起,称为功能性异常,此类异常
当37岁浙大博导决定去“送外卖”
2024年12月,杭州的天气湿冷入骨,浙江大学经济学院百人计划研究员、博士生导师袁哲穿上骑手服,骑着小电驴出发了。这次,他接到了人生中最远的一单——顾客点了两杯奶茶,距离在10公里开外。到西溪天街取餐,去华东院送餐,在寒风中骑行40分钟后,袁哲完成了订单。APP显示“本单收益12.3元”,这让袁哲很
ZLG深度解析:语音识别技术(一)
语音识别已成为人与机器通过自然语言交互重要方式之一,本文将从语音识别的原理以及语音识别算法的角度出发为大家介绍语音识别的方案及详细设计过程。语言作为人类的一种基本交流方式,在数千年历史中得到持续传承。近年来,语音识别技术的不断成熟,已广泛应用于我们的生活当中。语音识别技术是如何让机器“听懂”
ZLG深度解析:语音识别技术(二)
6、波束形成波束形成是指将一定几何结构排列的麦克风阵列的各个麦克风输出信号,经过处理(如加权、时延、求和等)形成空间指向性的方法,可用于声源定位和混响消除等。波束形成主要分为:固定波束形成、自适应波束形成和后置滤波波束形成等。2语音识别的基本原理已知一段语音信号,处理成声学特征向量之后表示为
高压语音核相仪的特点
高压语音核相仪主要应用于电力线路、变电所的相位校验和相序校验,具有核相、测相序、验电等功能,具备很强的抗干扰性,符合(EMC)标准要求,适应各种电磁场干扰场合。 将被测高电压相位信号由采集器取出,经过处理后直接发射出去,由核相仪接收并进行相位比较,由核相后的结果定性。 因本产品
OpenAI发布语音模型GPTrealtime
8月28日,美国人工智能公司OpenAI发布了其所谓“最先进的语音到语音模型”GPT-realtime,以及配套的Realtime API(实时应用程序接口)。据OpenAI公司介绍,该模型在理解复杂指令、精准调用工具以及生成自然、富有表现力的语音方面表现突出,并在客户服务、教育、个人助理等多种场景
听农民夸“农村电网改造”
2010年7月,全国新一轮农村电网改造正式启动。近两年来,国家电网公司积极有效地推进这项工程,很多地区农村用电不足的局面得到了改善。不久前,记者走进农村,在三个村里看见了农网改造带来的新变化。 河北:电器能可心往家买了 “这下可好了,新安了变压器,电器能可心往家买
矢量水听器的概述
水声学作为声学的一个分支,主要研究声波在水下的产生、辐射、传播和接收的理论,用以解决与水下目标探测、识别以及信息传输过程有关的声学问题。在海战中,声纳是海上作战个体(各种舰、艇)的五官,所有的水下战场侦察都要以声纳为媒体,缺之不可。水声换能器作为声纳系统的重要部件之一,是水声学的一个重要研究方向
如何选购恒温摇床之听
“看”的过程完成后,我们对摇床的外观有了基本的概念,接下去我们再通过“听”的来考核摇床实际运行的效果。摇床顾明思议是用来长期连续不断运转的,而且要求运行时噪音小,运行平稳,稳定性好,所以摇床在生产过程中对机械加工有着较高的工艺要求。机械系统也是整个摇床的核心部分。机械系统也是整个摇床的核
用光“听”出山那边的动静
一根头发丝粗细的光纤,可以变身顺风耳?将光纤一路铺去,就能将沿途动静实时传递回来?如果可以做到,那绵延山区的边境线、遍布全国的高铁网络,就都能轻而易举地做到实时监控了。 中科院上海光机所的科学家找到了一种独门秘技,将这个诱人的“如果”变成了现实。目前,“分布式光纤振动传感技术”已通过与公司合作