سۈنئىي ئىدراك2026-09

ئاۋاز AI — ASR ۋە TTS تولۇق قوللانما

ئاۋاز تونۇش (ASR) ۋە ئاۋاز ھاسىللاش (TTS) قانداق ئىشلەيدۇ، ئۇيغۇرچە ئۈچۈن قىيىنچىلىقى نېمە ۋە نەتىجىنى قانداق ياخشىلاش

ئاۋاز تونۇش (ASR) ۋە ئاۋاز ھاسىللاش (TTS) — ئۇيغۇرچە تولۇق قوللانما

ئاۋاز AI: ASR ۋە TTS

ئاۋاز بىلەن مۇناسىۋەتلىك سۈنئىي ئىدراك ئىككى يۆنىلىشتىن تۈزۈلىدۇ: ئاۋازنى تېكىستكە ئايلاندۇرۇش (ASR) ۋە تېكىستنى ئاۋازغا ئايلاندۇرۇش (TTS). بىرى ئاڭلايدۇ، يەنە بىرى سۆزلەيدۇ.

بۇ ئىككىسى ئۇيغۇرچە ئۈچۈن ئالاھىدە قىممەتلىك، چۈنكى ئۇيغۇر مەدەنىيىتىنىڭ زور قىسمى ئاۋازدا ساقلانغان — ناخشا، ھېكايە، دەرس، سۆھبەت. ئۇلارنى تېكىستكە ئايلاندۇرمىغۇچە ئىزدىگىلىمۇ، تەھلىل قىلغىلىمۇ بولمايدۇ.

ASR — ئاۋاز تونۇش قانداق ئىشلەيدۇ

ASR (Automatic Speech Recognition) ئاۋاز تولقۇنىنى تېكىستكە ئايلاندۇرىدۇ. جەريان تۆت باسقۇچتىن تۈزۈلىدۇ.

ئاۋازنى سانلاشتۇرۇش: مىكروفوندىن كەلگەن ئانالوگ سىگنال سانلىق شەكىلگە ئايلاندۇرۇلىدۇ (ئادەتتە سېكۇنتىغا 16000 نۇقتا).

ئالاھىدىلىك ئاجرىتىش: ئاۋاز كىچىك بۆلەكلەرگە بۆلۈنۈپ، ھەر بۆلەكنىڭ چاستوتا خۇسۇسىيىتى (مەسىلەن mel-spectrogram) ھېسابلىنىدۇ.

ئاكۇستىك مودېل: نېرۋا تورى بۇ خۇسۇسىيەتتىن تاۋۇشنى پەرەز قىلىدۇ.

تىل مودېلى: پەرەز قىلىنغان تاۋۇشلار سۆز ۋە جۈملىگە ئايلاندۇرۇلىدۇ. مۇشۇ باسقۇچ «ئۇ كەلدى» بىلەن «ئۇ كەلدى؟» نى پەرقلەندۈرىدۇ.

ھازىرقى سىستېمىلار بۇ تۆت باسقۇچنى ئايرىم ئەمەس، بىر Transformer مودېلىدا بىرلەشتۈرۈپ ئىشلەيدۇ. OpenAI نىڭ Whisper مودېلى ۋە Meta نىڭ wav2vec 2.0 مودېلى ئەڭ كۆپ ئىشلىتىلىدىغان ئوچۇق ئاساسلار.

ASR ئۆلچەملىرى

ئاۋاز تونۇشنىڭ توغرىلىقى ئادەتتە WER بىلەن ئۆلچىنىدۇ.

ئۆلچەممەنىسىئىزاھات
WER (Word Error Rate)سۆز خاتالىق نىسبىتىخاتا، چۈشۈپ قالغان ۋە ئارتۇق قوشۇلغان سۆزلەرنىڭ ئومۇمىي سۆزگە نىسبىتى. تۆۋەن بولسا ياخشى.
CER (Character Error Rate)ھەرپ خاتالىق نىسبىتىھەرپ دەرىجىسىدە ئۆلچەيدۇ. ئۇيغۇرچىدەك قوشۇمچە كۆپ تىللاردا WER دىن ئادىل.
RTF (Real Time Factor)رېئال ۋاقىت كۆرسەتكۈچى1 مىنۇتلۇق ئاۋازنى قانچە مىنۇتتا بىر تەرەپ قىلىدۇ. 1 دىن كىچىك بولسا رېئال ۋاقىتتىن تېز.

دىققەت: ئىنگلىزچىدە %5 WER «ياخشى» دەپ قارىلىدۇ. ئۇيغۇرچىدەك تۆۋەن مەنبەلىك تىللاردا بۇ سان تېخىمۇ يۇقىرى بولىدۇ، شۇڭا ئىنگلىزچە نەتىجىسى بىلەن بىۋاسىتە سېلىشتۇرۇش خاتا.

TTS — ئاۋاز ھاسىللاش قانداق ئىشلەيدۇ

TTS (Text to Speech) تېكىستنى ئاڭلىنىدىغان ئاۋازغا ئايلاندۇرىدۇ. ھازىرقى سىستېمىلار ئىككى بۆلەكتىن تۈزۈلىدۇ.

ئاكۇستىك مودېل: تېكىستنى ئاۋازنىڭ چاستوتا خەرىتىسىگە (mel-spectrogram) ئايلاندۇرىدۇ. ئاھاڭ، توختاش ۋە ئۇرغۇ مۇشۇ يەردە بېكىتىلىدۇ.

Vocoder — ئاۋاز ھاسىللىغۇچ: چاستوتا خەرىتىسىنى ھەقىقىي ئاۋاز تولقۇنىغا ئايلاندۇرىدۇ.

ئاۋازنىڭ «مېخانىك» ئاڭلىنىشى كۆپىنچە ئاكۇستىك مودېلدىن كېلىدۇ — توختاش ۋە ئۇرغۇ توغرا چۈشمىسە، تاۋۇش توغرا بولسىمۇ تەبىئىي ئاڭلانمايدۇ.

ئۇيغۇرچە ئۈچۈن قىيىنچىلىقلار

سانلىق مەلۇمات ئاز: ASR مودېلىنى تەربىيەلەش ئۈچۈن ئاۋاز ۋە ئۇنىڭغا ماس تېكىست بىللە كېرەك. ئىنگلىزچىدە مىڭلىغان سائەتلىك بۇنداق ماتېرىيال بار، ئۇيغۇرچىدە خېلى ئاز.

شېۋە پەرقى: قەشقەر، ئىلى، تۇرپان شېۋىلىرى ئارىسىدىكى تەلەپپۇز پەرقى مودېلنى قىينايدۇ. بىر شېۋە بىلەن تەربىيەلەنگەن مودېل باشقىسىدا ناچار ئىشلەيدۇ.

كود ئارىلاشتۇرۇش: كۈندىلىك سۆزلەشتە خەنزۇچە، ئىنگلىزچە ياكى روسچە سۆز ئارىلىشىپ كېتىدۇ. مودېل بۇنى ئالدىن كۆرمىگەن بولسا خاتالىشىدۇ.

ئىملا ئۆلچىمى: ئوخشاش سۆزنىڭ بىر نەچچە خىل يېزىلىشى بولسا، مودېل قايسىنى چىقىرىشنى بىلەلمەيدۇ ۋە باھالاشمۇ ئادىلسىز بولىدۇ.

ئۆز مودېلىڭىزنى ياخشىلاش

تۆۋەن مەنبەلىك تىلدا ئەڭ ئۈنۈملۈك يول — نۆلدىن تەربىيەلەش ئەمەس، تەييار مودېلنى ئۆز سانلىق مەلۇماتىڭىز بىلەن نازۇك تەڭشەش (fine-tuning).

30-50 سائەتلىك سۈپەتلىك ئاۋاز + توغرا كۆچۈرۈلگەن تېكىست بولسا سەزگۈر ياخشىلىنىش كۆرۈنىدۇ.

ئاۋازنى بىر خىل ئۆلچەمدە (16 kHz، mono، WAV) تەييارلاڭ.

تېكىستنى بىرلىككە كەلتۈرۈڭ: تىنىش بەلگىسى، سان يېزىلىشى ۋە ئىملا ئۆلچىمى بىردەك بولسۇن.

سىناق توپلىمىنى تەربىيە توپلىمىدىن پۈتۈنلەي ئايرىڭ — ئوخشاش سۆزلىگۈچىنىڭ ئاۋازى ئىككى توپلامدا بولمىسۇن، بولمىسا نەتىجە ئالدامچى چىقىدۇ.

ئەمەلىي قوللىنىش

ساھەASRTTS
مائارىپدەرس ئاۋازىنى خاتىرىگە ئايلاندۇرۇشدەرسلىكنى ئاۋازلىق كىتاب قىلىش
ئاخباراتسۆھبەتنى ئاپتوماتىك كۆچۈرۈشماقالىنى ئاڭلاشچان قىلىش
مەدەنىيەتئاغزاكى ھېكايە ۋە ناخشىنى ئارخىپلاشكونا تېكىستنى ئاۋازلاندۇرۇش
ئېھتىياجلىقلارئاڭلاش ئاجىزلىرىغا خەت چۈشۈرۈشكۆزى ئاجىزلارغا ئوقۇپ بېرىش

مەنبەلەر

OpenAI Whisper — ئوچۇق كودلۇق كۆپ تىللىق ASR مودېلى: https://github.com/openai/whisper

Meta wav2vec 2.0 — ئاز بەلگىلەنگەن سانلىق مەلۇمات بىلەن ئۆگىنىدىغان ئاۋاز مودېلى

Hugging Face — ئاۋاز مودېللىرى توپلىمى: https://huggingface.co/models

تۈزگۈچى: سۈنئىي ئىدراك — idirak.com ئۈچۈن ئاۋاز AI ئۇيغۇرچە قوللانمىسى

ASR · TTS · Whisper · wav2vec · WER

كۆپ سورىلىدىغان سوئاللار

ASR بىلەن TTS نىڭ پەرقى نېمە؟
ASR (Automatic Speech Recognition) ئاۋازنى تېكىستكە ئايلاندۇرىدۇ — يەنى ئاڭلايدۇ. TTS (Text to Speech) تېكىستنى ئاۋازغا ئايلاندۇرىدۇ — يەنى سۆزلەيدۇ. ئىككىسى قارىمۇ-قارشى يۆنىلىش.
ئۇيغۇرچە ئاۋاز تونۇش نېمە ئۈچۈن خاتالىشىدۇ؟
تۆت سەۋەب بار: تەربىيەگە كېرەكلىك ئاۋاز-تېكىست جۈپلىمىسى ئاز؛ قەشقەر، ئىلى ۋە تۇرپان شېۋىلىرىنىڭ تەلەپپۇزى ئوخشىمايدۇ؛ كۈندىلىك سۆزلەشتە باشقا تىلدىن سۆز ئارىلىشىدۇ؛ ۋە ئىملا ئۆلچىمى بىردەك ئەمەس.
WER نېمە؟
WER (Word Error Rate) — سۆز خاتالىق نىسبىتى. خاتا، چۈشۈپ قالغان ۋە ئارتۇق قوشۇلغان سۆزلەرنىڭ ئومۇمىي سۆز سانىغا نىسبىتى؛ تۆۋەن بولسا ياخشى. ئۇيغۇرچىدەك قوشۇمچە كۆپ تىللاردا ھەرپ دەرىجىسىدىكى CER تېخىمۇ ئادىل ئۆلچەم.
ئۆز ئاۋاز مودېلىمنى قانداق ياخشىلايمەن؟
نۆلدىن تەربىيەلىمەڭ — تەييار مودېلنى ئۆز سانلىق مەلۇماتىڭىز بىلەن نازۇك تەڭشەڭ (fine-tuning). 30-50 سائەتلىك سۈپەتلىك ئاۋاز ۋە توغرا كۆچۈرۈلگەن تېكىست بولسا سەزگۈر ياخشىلىنىش كۆرۈنىدۇ. سىناق توپلىمىدىكى سۆزلىگۈچى تەربىيە توپلىمىدا بولمىسۇن.