跳到主要內容

臺灣博碩士論文加值系統

(216.73.216.91) 您好!臺灣時間:2026/08/11 02:31
字體大小: 字級放大   字級縮小   預設字形  
回查詢結果 :::

詳目顯示

我願授權國圖
: 
twitterline
研究生:賴立釧
研究生(外文):LaiLi-Chuan
論文名稱:運用語音辨識技術在英漢電子字典之設計
論文名稱(外文):The design for electronic dictionary using speech recognition technology
指導教授:郭崇仁郭崇仁引用關係
指導教授(外文):Chung-Jen Kuo
學位類別:碩士
校院名稱:崑山科技大學
系所名稱:電機工程研究所
學門:工程學門
學類:電資工程學類
論文種類:學術論文
論文出版年:2005
畢業學年度:93
論文頁數:86
中文關鍵詞:隱藏式馬可夫模型維特比演算法語音辨識
外文關鍵詞:viterbi Algorithmhidden markov modelspeech recognition
相關次數:
  • 被引用被引用:0
  • 點閱點閱:812
  • 評分評分:
  • 下載下載:0
  • 收藏至我的研究室書目清單書目收藏:0
本論文運用隱藏式馬可夫模型及維特比演算法作為語音辨識研究的主要工具。首先將語音訊號做一連串的前置處理,步驟分別為:去除靜音、音框處理、預強調、及加窗處理等,接著再對語音訊號求取特徵參數,而所求取的特徵參數包含倒頻譜參數和差分倒頻譜參數。在特徵參數擷取出來之後,就可以利用隱藏式馬可夫模型及維特比演算法來訓練語音模型並進行待測語音的辨識工作。在去除靜音的步驟裡,我們採用時域端點偵測,此法是根據訊號能量參數(Energy)及越零率參數(Zero Crossing Rate)來做靜音與否的判別。同時我們還發展出双門限端點偵測法,來改善含雜訊語音的端點偵測所產生的誤差。
另外本論文還以Visual Basic 6.0 為發展工具,實際設計了一個語音辨識系統,此系統共分三個部分,分別為「模型訓練」、「辨識語料」、「分析模擬」。在此語音辨識系統中,我們還設計了一個語音英漢字典的功能,提供『語音輸入』的方式,將欲輸入查詢單字的英文字母輸入到電子字典進行翻譯的工作,以簡化查英文單字的工作。
In this dissertation, hidden Markov models and Viterbi algorithm are the major tools for speech recognition research to develop a simulation system of English-Chinese electronic dictionary. First, the speech signal is pre-processed to extract the speech characteristic coefficients through the following steps including cepstral coefficient and differential cepstral coefficient. Furthermore, the hidden Markov models and Viterbi algorithm are proposed to train the vocal models and perform the recognition task. In speech signal, end-point detection process is carried out to discard the silent periods. This method is based on signal energy parameter and zero-crossing rate to discern the speech signal is in silent period or not. We also developed a double threshold end-point detection method to correct the distortion caused by additive noise in the regular end-point detection.

In addition, we utilized Visual Basic 6.0 as the development tool to create a vocal recognition system including three parts: model training, speech recognition, and simulation. Based on above system, we also designed an English-Chinese electronic dictionary that offers vocal input. With this function, we simply input the words through your voice not the keyboard to simplify the task of “look it up”.
中文摘要......i
英文摘要......iii
致謝......v
目錄......vi
圖目錄......x
第一章 緒論
1.1 前言.......1
1.2研究動機......4
1.3 研究背景及文獻回顧......5
第二章 語音前置處理
2.1 簡介......8
2.2 去除直流偏壓......8
2.3 音框處理......9
2.3.1 音框寬度......9
2.3.2 音框重疊......10
2.3.3 固定音框分析框.......12
2.3.4 變動音框寬度分析框......13
2.3.5 變動寬度分析框......14
2.4 加窗處理......15
2.4.1 矩形窗......16
2.4.2 漢明窗......17
第三章 端點偵測演算法
3.1 簡介.......20
3.2 短時能量......20
3.2.1能量參數的性質......21
3.3 預前濾波......23
3.4 雜訊能量消除法......25
3.5 短時越零率......27
3.6 門限過零率......28
3.7 R-S端點偵測法......30
3.8 改良式R-S端點偵測法......32
第四章 語音訊號的特徵萃取
4.1 簡介......35
4.2 前置強波處理......35
4.3 線性預測倒頻譜參數......37
4.3.1線性預測編碼......37
4.3.2線性預測參數倒頻譜轉換......41
第五章 語音模型的建立與辨識方法
5.1簡介......43
5.2隱藏式馬可夫模型......43
5.3訓練語音模型......46
5.3.1初始模型-均切音框數......47
5.3.2狀態的平均值和變異數......47
5.3.3音框與狀態的相似程度......48
5.4維特比演算法......49
5.4.1更新狀態與音框的關係......53
5.5訓練語音模型......54
5.6辨識方法......54
第六章 實驗系統介面
6.1系統程式語言......56
6.2系統流程簡介......56
6.3語音特徵擷取......57
6.4語音模型訓練......60
6.5 語音辨識介面......60
6.6系統測試工具......61
6.7端點偵測模擬介面......64
6.8 語音英漢電子字典介面......66
第七章 實驗結果
7.1英文字母之辨識結果......68
7.2 英文單字之辨識結果......83
第八章 結論與未來展望
8.1 結論......85
8.2 未來展望......86
參考文獻.......87
圖1.1 語音辨識流程圖......3
圖1.2 語音英漢字典的架構圖......4
圖2.1 音框寬度大小對語音訊號分析的影響......10
圖2.2 音框重疊示意圖......11
圖2.3 固定寬度分析框之處理示意圖......13
圖2.4 變動分析框重疊寬度之處理示意圖......14
圖2.5 變動分析框寬度之處理示意圖......15
圖2.6 漢明窗、舉形窗波形圖與頻譜圖......16
圖2.7 500Hz之正弦波經過舉形窗處理之結果......17
圖2.8 500Hz之正弦波經過漢明窗處理之結果......19
圖3.1 中文數字”三”的語音波形圖......21
圖3.2 對數能量波形圖......21
圖3.3 平方和能量波形圖......22
圖3.4 絕對值能量波形圖......22
圖3.5 “apple”的語音波形圖......24
圖3.6 “apple”絕對值能量波型圖......24
圖3.7 “apple”絕對值能量經前濾波的結果......25
圖3.8 “apple”加入高頻雜訊之後的波形圖......26
圖3.9 “apple”加入高頻雜訊再經預前濾波後的絕對值能量波形圖......26
圖3.10“apple”經雜訊能量消除法後的絕對值能量圖.....26
圖3.11 越零率參數示意圖......27
圖3.12 Deep的語音波形圖......29
圖3.13 Deep的越零率參數圖形......29
圖3.14 受雜訊干擾之Deep的語音波形圖......29
圖3.15 受雜訊干擾之Deep的越零率參數圖......30
圖3.16 使用門限越零率改善後的結果......30
圖3.17 門限越零率參數示意圖......30
圖3.18 R-S端點偵測法的示意圖......32
圖3.19 中文“4”未加雜訊的端點偵測圖......33
圖3.20 中文“4”加雜訊未經改善的端點偵測圖......34
圖3.21 中文“4”加雜訊經過改善後的端點偵測圖......34
圖4.1 前置強波器之頻譜圖......36
圖4.2 前置強波器之應用實例......36
圖4.3 擷取線性預估倒頻譜參數流程圖......37
圖5.1訓練語音模型流程圖......46
圖5.2 每個音框跟每個狀態的相似機率示意圖......49
圖5.3 音框和狀態關係之所有可能路徑......50
圖5.4 路徑限制示意圖......51
圖5.5 比較 和 的大小......52
圖5.6 將值較大的 加到......52
圖5.7 路徑迴塑示意圖......53
圖6.1 系統輸入語音資料介面......57
圖6.2 語音特徵擷取介面......58
圖6.3 語音特徵值轉成圖形的介面......59
圖6.4 轉換後所輸出的語音特徵圖形......59
圖6.5 訓練模型的操作介面......60
圖6.6 語音辨識介面......61
圖6.7 三個狀態的路徑限制......62
圖6.8 三個狀態所搜尋出來的最佳狀態移轉路徑......63
圖6.9 六個狀態的路徑限制......63
圖6.10 六個狀態的最佳狀態移轉路徑......64
圖6.11 端點偵測操作介面......65
圖6.12 端點偵測模擬結果......65
圖6.13 語音英漢電子字典執行的畫面......67
圖7.1 字母A的辨識結果.......68
圖7.2 字母B的辨識結果......69
圖7.3 字母C的辨識結果......69
圖7.4 字母D的辨識結果......70
圖7.5 字母E的辨識結果......70
圖7.6 字母F的辨識結果......71
圖7.7 字母G的辨識結果......71
圖7.8 字母H的辨識結果......72
圖7.9 字母I的辨識結果......72
圖7.10 字母J的辨識果......73
圖7.11 字母K的辨識結果......73
圖7.12 字母L的辨識結果......74
圖7.13 字母M的辨識結果......74
圖7.14 字母N的辨識結果......75
圖7.15 字母O的辨識結果......75
圖7.16 字母P的辨識結果......76
圖7.17 字母Q的辨識結果......76
圖7.18 字母R的辨識結果......77
圖7.19 字母S的辨識結果......77
圖7.20 字母T的辨識結果......78
圖7.21 字母U的辨識結果......78
圖7.22字母V的辨識結果......79
圖7.23 字母W的辨識結果......79
圖7.24 字母X的辨識結果......80
圖7.25 字母Y的辨識結果......80
圖7.26 字母Z的辨識結果.......81
圖7.27英文字母之平均辨識率......81
[1] X.D. Huang and K.F. Lee, “On Speaker-Independent,Speaker-Dependent, and Speaker-Adaptive Speech Recognition,” IEEE Trans on ASSP,1991
[2] P. Woodland, “Speech Recognition,” IEE, 1998
[3] H.Sakoe and S. Chiba, “Dynamic Programming
Optimization for Spoken Word Recognition,” IEEE Trans on ASSP ,Vol.26,pp 43-49,feb.1978.
[4] C. Myers and L.R. Babiner, “Performance Tradeoffs in Dynamic Time Warping Algorithms for Isolated Word Recognition,” IEEE Trans on ASSP, Vol.28,No.6,pp 623-635, Dec. 1980
[5] D.P Morgan and C.L. Scofield , Neural Networks and Speech Processing, Kluwer-Academic , 1991.
[6] L.R. Rabiner, “A Tutorial on Hidden Markov Models and Selected Applications in Speech Recognition,” IEEE Trans on ASSP,Vol.77 , No.2 , pp 257-286,Feb. 1989.
[7] L.R. Rabiner and B.H. Juang,Fundamentals of Speech Recognition, Prentice Hall, pp 200-233,1993
[8] F. Runstein and F. Violaro, “An Isolated-
Recognition System Using Neural Networks,” IEEE Trans on ASSP ,pp 550-553,1996
[9] He Qiang, Zhang Youwei , “On Prefiltering and Endpoint Detection of Speech Signal”,Signal
Processing Pro. , Fourth International Conference on ,12-16 Oct. 1998
[10] L.F. Lamel and L.R. Rabiner , “An Improved Endpoint Detection for Isolated Word Recognition”,IEEE Trans on ASSP, Vol.29, No.4, pp 777-785, Aug. 1981
[11] E. Keller, Fundamentals of Speech Synthesis and Speech Recognition Basic Concepts, State of the Art and Future Challenges,John Wiley andSons,1994
[12] L. R. Rabiner and R.W. Schafer, Digital Processing of Speech Signals, Prentice Hall, 1978.
[13] Markel J.D. and Gray A.H., Jr.Linear “Prediction of Speech Springer-Verlag,” Berlin/New York,1976
[14] Gray A.H. and Markel J.D “Distance measure for speech processing,” IEEE Trans Acoust. Speech Signal Process. 24,P380-391,1976
[15] Juang ,B.H.,Rabiner ,L.R, and Wilpon , J.G. “On the use of bandpass liftering in speech recognition, ” .IEEE Trans. Acoust .Speech Signal process.
[16] L.E. Baum, T.Petrie, G.R. Soules,and N. Weiss, “A maximization technique occurring in the statistical analysis of probabilistic functions of Markov chains” , Ann. Math., Stat. , vol. 41, no.1,pp 164-171, 1970
[17] J.K. Baker, “The dragon system-An overview”, IEEE Trans. Acoustics,Speech, Signal Proc.,ASSP-23(1):24-29,1975.
[18] F. Jelinek , “ A fast sequential decoding algorithm using a stack”, IBM J. Res. Develop., 13:675-685,1969
[19] Frederick Jelinek, “Statistical methods for speech recognition recognition”, Mass. :MIT Press, Cambridge, 1998
[20] HUI-LING LOU “Implementing the viterbi Algorithm”,IEEE Trans. Acoust .Speech Signal Process.
[21] 陳尊立,陳松琳。“以類神經網路為架構之語音辨識系統 ”。碩士論文,國立中山大學電機工程系,高雄,2002。
[22] 李宗寶,劉文惠。“ 用Viterbi 演算法於MFCC特徵之國語數字辨識 ”,國立中興大學應用數學研究所統計組,台中,2004
[23] 謝依蘭。“ 語音訊號數位處理 ”。台北市,旗標,1994
[24] 謝秀琴。“ 數位語音訊號基本原理 ”。台北市,全華,1996
[25] 陳明棼。“ PC 電腦語音辨識實作 ”。台北市,旗標,1994
[26] 楊鎮光。“ Visual Basic 與語音辨識-讓電腦聽話 ”。台北市,松岡,2002
[27] 王小川。“ 語音訊號處理 ”。台北市,全華,2004
[28]張志星。“音訊處理與辨識”。國立清華大學,網址:www.cs.nthu.edu.tw/~jang
QRCODE
 
 
 
 
 
                                                                                                                                                                                                                                                                                                                                                                                                               
第一頁 上一頁 下一頁 最後一頁 top