VC编程实现文本语音转换
- 1、下载文档前请自行甄别文档内容的完整性,平台不提供额外的编辑、内容补充、找答案等附加服务。
- 2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
- 3、如文档侵犯您的权益,请联系客服反馈,我们会尽快为您处理(人工客服工作时间:9:00-18:30)。
文本语音(Text-to-Speech,以下简称TTS),它的作用就是把通过TTS引擎把文本转化为语音输出。本文不是讲述如何建立自己的TTS引擎,而是简单介绍如何运用Microsoft Speech SDK建立自己的文本语音转换应用程序。
Microsoft Speech SDK简介
Microsoft Speech SDK是微软提供的软件开发包,提供的Speech API(SAPI)主要包含两大方面:
1.API for Text-to-Speech
2.API for Speech Recognition
其中API for Text-to-Speech,就是微软TTS引擎的接口,通过它我们可以很容易地建立功能强大的文本语音程序,金山词霸的单词朗读功能就用到了这写API,而目前几乎所有的文本朗读工具都是用这个SDK开发的。至于API for Speech Recognition就是与TTS 相对应的语音识别,语音技术是一种令人振奋的技术,但由于目前语音识别技术准确度和识别速度不太理想,还未达到广泛应用的要求。
Microsoft Speech SDK可以在微软的网站免费下载,目前的版本是5.1,为了支持中文,还要把附加的语言包(LangPack)一起下载。
为了在VC中使用这SDK,必需在工程中添加SDK的include和lib目录,为免每个工程都添加目录,最好的办法是在VC的
Tools->Options->Directories立加上SDK的include和lib目录。
一个最简单的例子
先看一个入门的例子:
#include<sapi.h>
#pragma comment(lib,"ole32.lib")//CoInitialize CoCreateInstance需要调用ole32.dll
#pragma comment(lib,"sapi.lib")//sapi.lib在SDK的lib目录,必需正确配置
int main(int argc,char*argv[])
{
ISpVoice*pVoice=NULL;
//COM初始化:
if(FAILED(::CoInitialize(NULL)))
return FALSE;
//获取ISpVoice接口:
HRESULT hr=CoCreateInstance(CLSID_SpVoice,NULL,CLSCTX_ALL,
IID_ISpVoice,(void**)&pVoice);
if(SUCCEEDED(hr))
{
hr=pVoice->Speak(L"Hello world",0,NULL);
pVoice->Release();
pVoice=NULL;
}
//千万不要忘记:
::CoUninitialize();
return TRUE;
}
短短20几行代码就实现了文本语音转换,够神奇吧。SDK提供的SAPI是基于COM封装的,无论你是否熟悉COM,只要按部就班地用CoInitialize(),CoCreateInstance()获取IspVoice接口就够了,需要注意的是初始化COM后,程序结束前一定要用CoUninitialize()释放资源。
IspVoice接口主要函数
上述程序的流程是获取IspVoice接口,然后用ISpVoice::Speak()把文本输出为语音,可见,程序的核心就是IspVoice接口。除了Speak外IspVoice接口还有许多成员函数,具体用法请参考SDK的文档。下面择要说一下几个主要函数的用法:HRESULT Speak(const WCHAR*pwcs,DWORD dwFlags,ULONG*pulStreamNumber);
功能:就是speak了
参数:
*pwcs输入的文本字符串,必需为Unicode,如果是ansi字符串必需先转换为Unicode。
dwFlags用来标志Speak的方式,其中SPF_IS_XML表示输入文本含有XML标签,这个下文会讲到。
PulStreamNumber输出,用来获取去当前文本输入的等候播放队列的位置,只有在异步模式才有用。
HRESULT Pause(void);
HRESULT Resume(void);
功能:一看就知道了。
HRESULT SetRate(long RateAdjust);
HRESULT GetRate(long*pRateAdjust);
功能:设置/获取播放速度,范围:-10to10
HRESULT SetVolume(USHORT usVolume);
HRESULT GetVolume(USHORT*pusVolume);
功能:设置/获取播放音量,范围:0to100
HRESULT SetSyncSpeakTimeout(ULONG msTimeout);
HRESULT GetSyncSpeakTimeout(ULONG*pmsTimeout);
功能:设置/获取同步超时时间。由于在同步模式中,电泳Speak后程序就会进入阻塞状态等待Speak返回,为免程序长时间没相应,应该设置超时时间,msTimeout单位为毫秒。
HRESULT SetOutput(IUnknown*pUnkOutput,BOOL fAllowFormatChanges);
功能:设置输出,下文会讲到用SetOutput把Speak输出问WAV文件。
这些函数的返回类型都是HRESULT,如果成功则返回S_OK,错误有各自不同的错误码。
使用XML
个人认为这个TTS api功能最强大之处在于能够分析XML标签,通过XML标签设置音量、音调、延长、停顿,几乎可以使输出达到自然语音效果。前面已经提过,把Speak参数dwFlags