1 |
Jira: a Kurdish Speech Recognition System Designing and Building Speech Corpus and Pronunciation Lexicon
|
|
|
|
In: https://hal.archives-ouvertes.fr/hal-03140680 ; 2021 (2021)
|
|
Abstract:
In this paper, we introduce the first large vocabulary speech recognition system (LVSR) for the Central Kurdish language, named Jira. The Kurdish language is an Indo-European language spoken by more than 30 million people in several countries, but due to the lack of speech and text resources, there is no speech recognition system for this language. To fill this gap, we introduce the first speech corpus and pronunciation lexicon for the Kurdish language. Regarding speech corpus, we designed a sentence collection in which the ratio of di-phones in the collection resembles the real data of the Central Kurdish language. The designed sentences are uttered by 576 speakers in a controlled environment with noise-free microphones (called AsoSoft Speech-Office) and in Telegram social network environment using mobile phones (denoted as AsoSoft Speech-Crowdsourcing), resulted in 43.68 hours of speech. Besides, a test set including 11 different document topics is designed and recorded in two corresponding speech conditions (i.e., Office and Crowdsourcing). Furthermore, a 60K pronunciation lexicon is prepared in this research in which we faced several challenges and proposed solutions for them. The Kurdish language has several dialects and sub-dialects that results in many lexical variations. Our methods for script standardization of lexical variations and automatic pronunciation of the lexicon tokens are presented in detail. To setup the recognition engine, we used the Kaldi toolkit. A statistical tri-gram language model that is extracted from the AsoSoft text corpus is used in the system. Several standard recipes including HMM-based models (i.e., mono, tri1, tr2, tri2, tri3), SGMM, and DNN methods are used to generate the acoustic model. These methods are trained with AsoSoft Speech-Office and AsoSoft Speech-Crowdsourcing and a combination of them. The best performance achieved by the SGMM acoustic model which results in 13.9% of the average word error rate (on different document topics) and 4.9% for the general topic.
|
|
Keyword:
[INFO.INFO-AI]Computer Science [cs]/Artificial Intelligence [cs.AI]; [SCCO.LING]Cognitive science/Linguistics; Jira; Kurdish Language; Pronunciation Lexicon; Speech Corpus; Speech Recognition
|
|
URL: https://hal.archives-ouvertes.fr/hal-03140680/file/Jira%20a%20Kurdish%20Speech%20Recognition%20System.pdf https://hal.archives-ouvertes.fr/hal-03140680/document https://hal.archives-ouvertes.fr/hal-03140680
|
|
BASE
|
|
Hide details
|
|
2 |
Des corpus numériques à l’analyse linguistique en langues de spécialité
|
|
|
|
In: https://hal-univ-paris.archives-ouvertes.fr/hal-03167849 ; Editions Université Grenoble-Alpes (UGA), Collection « Langues, gestes, parole ». 2021, Elisabetta Carpitelli et Jean Marc Colletta ; https://www.uga-editions.com (2021)
|
|
BASE
|
|
Show details
|
|
3 |
Corpora of interactions in language training for migrants ; Des corpus d'interactions dans la formation linguistique des migrants
|
|
|
|
In: ISSN: 1763-4229 ; Savoirs. Revue internationale de recherches en éducation et formation des adultes ; https://hal.archives-ouvertes.fr/hal-03559403 ; Savoirs. Revue internationale de recherches en éducation et formation des adultes, L'Harmattan, 2021 (2021)
|
|
BASE
|
|
Show details
|
|
4 |
Ceci est mon corps : Le corps de l'enseignant dans la classe
|
|
|
|
In: La réussite scolaire, universitaire et professionnelle : Conditions, contextes, innovations ; https://hal.archives-ouvertes.fr/hal-03445312 ; P. Terrien et N. Olympio. La réussite scolaire, universitaire et professionnelle : Conditions, contextes, innovations, Presses Universitaires de Provence, 2021, 9791032003374 (2021)
|
|
BASE
|
|
Show details
|
|
5 |
L’usage des termes difficulté(s) et trouble(s) dans un corpus de comptes rendus de bilans orthophoniques.
|
|
|
|
In: ISSN: 2552-7665 ; L’Entre-deux ; https://hal.archives-ouvertes.fr/hal-03504599 ; L’Entre-deux, Université d'Artois - Textes & Cultures (EA 4028), A paraître ; https://lentre-deux.com/index.php?b=numero10 (2021)
|
|
BASE
|
|
Show details
|
|
6 |
Un nouveau regard sur la syntaxe russe ; Un nouveau regard sur la syntaxe russe: de l’erreur individuelle vers une tendance générale
|
|
|
|
In: 10th World Congres, ICCEES (the International Council for Central and East European Studies) ; https://hal.archives-ouvertes.fr/hal-03628377 ; 10th World Congres, ICCEES (the International Council for Central and East European Studies), Columbia University, Aug 2021, Montréal, Canada (2021)
|
|
BASE
|
|
Show details
|
|
7 |
When the Moment Does Not Last ; When the Moment Does Not Last: a Few Words On Moment-Constructions
|
|
|
|
In: 16th Annual Meeting of Slavic Linguistics Society (SLS-16) ; https://hal.archives-ouvertes.fr/hal-03628378 ; 16th Annual Meeting of Slavic Linguistics Society (SLS-16), University of Urbana, Sep 2021, Urbana, IL, United States (2021)
|
|
BASE
|
|
Show details
|
|
8 |
Effect of the communicational expertise of the caregivers' speech on the patient's speech ; Effet de l'expertise communicationnelle de la parole des soignants sur la prise de parole des soignés
|
|
|
|
In: https://tel.archives-ouvertes.fr/tel-03513872 ; Linguistique. Université Clermont Auvergne (UCA), Clermont-Ferrand, FRA., 2021. Français (2021)
|
|
BASE
|
|
Show details
|
|
9 |
A Multimodal Model for Predicting Conversational Feedbacks
|
|
|
|
In: International Conference on Text, Speech, and Dialogue (TSD ) ; https://hal.archives-ouvertes.fr/hal-03331446 ; International Conference on Text, Speech, and Dialogue (TSD ), 2021, Olomouc, Czech Republic (2021)
|
|
BASE
|
|
Show details
|
|
10 |
A Multimodal Model for Predicting Conversational Feedbacks
|
|
|
|
In: Text, Speech, and Dialogue 24th International Conference, TSD 2021, Olomouc, Czech Republic, September 6–9, 2021, Proceedings ; International Conference on Text, Speech, and Dialogue (TSD ) ; https://hal.archives-ouvertes.fr/hal-03331446 ; International Conference on Text, Speech, and Dialogue (TSD ), 2021, Olomouc, Czech Republic. ⟨10.1007/978-3-030-83527-9_46⟩ (2021)
|
|
BASE
|
|
Show details
|
|
11 |
Of Alpinists and Domestic and Wild Animals in the Alps (1857-1899): a Corpus Analysis
|
|
|
|
In: ISSN: 2431-1766 ; Caliban : French Journal of English Linguistics ; Animal Love / L'amour des animaux International conference /Colloque international ; https://hal.archives-ouvertes.fr/hal-02462511 ; Caliban : French Journal of English Linguistics, Presses Universitaires du Mirail, 2021, L’amour des animaux. Exploration des liens animaux dans la littérature et la culture anglophone / Animal Love. Considering Animal Attachments in Anglophone Literature and Culture, pp.189-211 (2021)
|
|
BASE
|
|
Show details
|
|
12 |
Un des plus anciens corpus textuels en marchois
|
|
|
|
In: Patoiseries de "La Soutrane" ; https://halshs.archives-ouvertes.fr/halshs-03379986 ; Patoiseries de "La Soutrane", L'Harmattan, pp.11-38, 2021, 978-2-343-24350-4 ; https://www.editions-harmattan.fr/livre-patoiseries_de_la_soutrane_marcel_remy-9782343243504-71344.html (2021)
|
|
BASE
|
|
Show details
|
|
13 |
Étude des chaînes de référence en français : liens entre modélisation linguistique et analyse quantitative
|
|
|
|
In: ISSN: 0037-9069 ; EISSN: 1783-1385 ; Bulletin de la Société de Linguistique de Paris ; https://halshs.archives-ouvertes.fr/halshs-03346119 ; Bulletin de la Société de Linguistique de Paris, Peeters Publishers, 2021, CXVI (1), pp.41-75 (2021)
|
|
BASE
|
|
Show details
|
|
14 |
Patoiseries de "La Soutrane" ; Patoiseries de "La Soutrane": Edition préfacée et traduite par Maximilien Guérin
|
|
|
|
In: https://halshs.archives-ouvertes.fr/halshs-03379967 ; L'Harmattan, 2021, Collection "Les Parlers du Croissant", 978-2-343-24350-4 ; https://www.editions-harmattan.fr/livre-patoiseries_de_la_soutrane_marcel_remy-9782343243504-71344.html (2021)
|
|
BASE
|
|
Show details
|
|
15 |
Geneviève Calame-Griaule et la performance du conte
|
|
|
|
In: Fabula / Les colloques ; https://halshs.archives-ouvertes.fr/halshs-03204756 ; Fabula / Les colloques, Fabula, 2021, Traduire, transposer, composer. Passages des arts verbaux extra-occidentaux en langue française ; http://www.fabula.org/colloques/document6954.php (2021)
|
|
BASE
|
|
Show details
|
|
16 |
Un outil d'exploration de corpus d'apprenants pour la didactique des langues secondes
|
|
|
|
In: Journées d'études « De l'acquisition à la didactique (et vice-versa) » ; https://hal.archives-ouvertes.fr/hal-03418871 ; Journées d'études « De l'acquisition à la didactique (et vice-versa) », Nov 2021, Paris, France (2021)
|
|
BASE
|
|
Show details
|
|
17 |
The Democrat corpus and its exploitation. Presentation ; Le corpus Democrat et son exploitation. Présentation
|
|
|
|
In: ISSN: 0458-726X ; EISSN: 1958-9549 ; Langages ; https://hal.archives-ouvertes.fr/hal-03474748 ; Langages, Armand Colin (Larousse jusqu'en 2003), 2021, Un corpus annoté en chaînes de référence et son exploitation : le projet Democrat, pp.11-24 ; https://www.revues.armand-colin.com/lettres-langues/langages/langages-no-224-42021/ (2021)
|
|
BASE
|
|
Show details
|
|
18 |
Exploration outillée pour un corpus de productions orales des apprenants débutants en L2
|
|
|
|
In: Colloque "Influence translinguisitique : où en est-on aujourd'hui ?" ; https://hal.archives-ouvertes.fr/hal-03471025 ; Colloque "Influence translinguisitique : où en est-on aujourd'hui ?", Jul 2021, Toulouse, France (2021)
|
|
BASE
|
|
Show details
|
|
19 |
Le corps a-t-il encore sa place dans l’enseignement à distance ?
|
|
|
|
In: ISSN: 2431-2134 ; The Conversation ; https://theconversation.com/le-corps-a-t-il-encore-sa-place-dans-lenseignement-a-distance-157915 ; https://hal.archives-ouvertes.fr/hal-03190182 ; https://theconversation.com/le-corps-a-t-il-encore-sa-place-dans-lenseignement-a-distance-157915, 2021 (2021)
|
|
BASE
|
|
Show details
|
|
20 |
Le corpus audiovisuel support de médiation en classe de langue et culture
|
|
|
|
In: Distance entre langues, distance entre cultures. Quelles incidences didactiques ? ; https://hal.campus-aar.fr/hal-03179723 ; Distance entre langues, distance entre cultures. Quelles incidences didactiques ?, 2021 (2021)
|
|
BASE
|
|
Show details
|
|
|
|