咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
【导语】大家好,我是程皓楠。今天想与大家探讨人工智能在音频领域的奥秘,从口耳对应的声音技术切入,看AI如何让机器“开口说话”“听音辨别”,涵盖AI语音合成、作曲、音效合成等技术,揭开其背后的原理与应用。

大家好,我是程皓楠,今天来这里呢,想和大家讨论一下人工智能在音频领域的基础原(yuán)理(lǐ)、当(dāng)前(qián)应用和未来趋势。
在人类的五官中,口和耳都是和声音息息相关的。与之相对应的,目前在音频领域,我们也是在重点探索如何借助人工智能的力量,让机器学会“开口说话”和“听音辨别”。这背后其实包含两大类技术,音频生成技术和音频检测技术。
AI语音合成
首先我们来聊一聊AI音频生成技术。大家可能在网络上见过很多虚拟主播,它们能说会道,声音还各具特色,有的甚至和真人主播难以(yǐ)分(fēn)辨(biàn)。这(zhè)背(bèi)后(hòu)的(de)核(hé)心(xīn)技(jì)术(shù)就(jiù)是(shì)AI语(yǔ)音(yīn)合(hé)成(chéng)。
每(měi)个(gè)人(rén)的(de)声(shēng)音(yīn)都(dōu)有(yǒu)独(dú)特(tè)的(de)音(yīn)色(sè),这(zhè)是(shì)由(yóu)声(shēng)带(dài)、喉(hóu)咙(lóng)等(děng)生(shēng)理(lǐ)结构以及说话习惯决定的。AI语音合成就是要让机器能够模仿这些人类的音色。那么它是怎么做到的呢?其实,工程师们会先收集大量的人类语音数据。然后,利用深度学习中的神经网络模型,对这些数据进行分析和学习。通过深度学习,AI能够捕捉到语音中的细微差别,比如发音时的共振峰频率、音强的变化规(guī)律(lǜ)等(děng)。当(dāng)需(xū)要(yào)生(shēng)成(chéng)虚(xū)拟(nǐ)主播(bō)的(de)语音时,AI就会根据输入的文本,按照学习到的特征来合成声音,从而让虚拟主播拥有接近真人的语音表现。

AI作曲技术
不仅是“开口说话”,机器现在也可以“开口唱歌”,这背后除了上面提到的语音合成技术,还有AI作曲技术。AI作曲并不是简单地随机组合音符,而是通过深度学习对大量的音乐作品进行分析和学习,掌握音乐的旋律、和声、节奏等规律,从而创作出新的音乐作品。工程师会给AI输入大量的(de)经(jīng)典(diǎn)音乐作品,让它学习不同风格的音乐特征,如古典音乐的严谨结构、流行音乐的动感节奏等。在学习过程中,AI会分析音乐中的旋律走向、和弦进行、节奏模式等,建立起音乐创作(zuò)的(de)模(mó)型(xíng)。在(zài)AI音乐创作场景中,用户只需要给定一些参数,如音乐风格、节奏快慢、调式等,AI模型就会根据所学的知识生成相应的旋律和和弦。

AI音效合成技术
此外,不仅是模拟人类说话、唱歌,机器还可以模拟各种音效。比如自然界的风声、雨声、动物叫声,还有科幻电影中的外星生物音效、未来科技设备的声音等。AI生成音效的原理和语音合成有一定相似之处,但是需要对大自然中多样化的声源进行更深入的分析和特征学习。比如引入一些物理声学规则作为先验知识来约束AI模型的生成内容。AI音效合成技术为影视创作带来了很多便利,它大大缩短了音效制作的时间。以前需要几天甚至几周才能完成的音效制作,现在通过AI可以在短时间内生成(chéng)多(duō)个(gè)候(hou)选(xuǎn)方(fāng)案(àn)。
本(běn)文为(wèi)·创(chuàng)作(zuò)培(péi)育(yù)计(jì)划(huà)扶(fú)持(chí)作(zuò)品(pǐn)
作(zuò)者(zhě):人民日报
审核:贾宁 大连东软信息学院 教授
出品:中国科协科普部
监制:中国科学技术出版社有限公司、北京中科星河文化传媒有限公司
来源: 创作培育计划

公众号

电话
需求反馈