Traductor de voz basado en procesamiento de lenguaje natural para asistencia a niños y jóvenes con dislalia

Autores/as

DOI:

https://doi.org/10.70929/caui3.v1i2.0012

Palabras clave:

Dislalia, reconocimiento de voz, procesamiento de lenguaje natural, terapia del habla

Resumen

El traductor de voz intenta corregir la dislalia en niños y jóvenes, para lo que se emplea tecnologías avanzadas de procesamiento de lenguaje natural. Se implementaron procedimientos como la selección de herramientas avanzadas (Vosk, Google Speech-to-Text y OpenAI Whisper) y el diseño de una interfaz intuitiva para garantizar la funcionalidad del prototipo. Se realizaron pruebas iterativas para validar el desempeño del sistema y recopilar retroalimentación de terapeutas y educadores. Los resultados mostraron que el sistema alcanzó un 90% de precisión promedio en el reconocimiento de voz, cumpliendo con los estándares establecidos. Además, se identificaron ciertas áreas de mejora, como la detección de fonemas complejos (/r/ y /s/), donde se registraron mayores tasas de error. Se concluye que el sistema presenta un impacto significativo en el ámbito educativo y terapéutico.

Biografía del autor/a

  • Luis González-Franco, Facultad de Ingeniería Industrial, Universidad de Guayaquil, Guayaquil 090514, Ecuador

    Luis González Franco es Ingeniero Industrial por la Universidad de Guayaquil.

  • James Sánchez-Calderón, Facultad de Ingeniería Industrial, Universidad de Guayaquil, Guayaquil 090514, Ecuador

    James Sánchez Calderón es Ingeniero Industrial por la Universidad de Guayaquil.

Referencias

[1] E. López-Hernández, P. Acosta-Rodas, J. Cruz-Cárdenas, and C. Ramos-Galarza, “Intervención musicoterapéutica para mejorar la memoria, atención y lenguaje in niños con dislalia.,” Revista Ecuatoriana de Neurologia, vol. 30, no. 2, pp. 48–56, Sep. 2021, doi: 10.46997/revecuatneurol30200048.

[2] N. R. Garofalo Cujilema and A. Y. Morán Melendez, “Bullying y estado emocional en estudiantes de sexto grado de Educación General Básica de la Unidad Educativa 24 de Mayo del cantón San Miguel de Bolívar,” BABAHOYO: UTB, 2024, 2024.

[3] M. I. Mendoza Loor and L. E. Loor Lino, “Labor de trabajador social frente al trabajo infantil de los niños, niñas y adolescentes en el cantón Portoviejo,” AlfaPublicaciones, vol. 3, no. 4, pp. 6–19, Oct. 2021, doi: 10.33262/ap.v3i4.106.

[4] N. E. G. Rivas, “Tecnolog’ia Asistiva para la Inclusión Educativa en Ecuador,” Ciencia Latina: Revista Multidisciplinar, vol. 8, no. 3, pp. 417–433, 2024.

[5] C. Bérubé et al., “Voice-Based Conversational Agents for the Prevention and Management of Chronic and Mental Health Conditions: Systematic Literature Review,” J Med Internet Res, vol. 23, no. 3, p. e25933, Mar. 2021, doi: 10.2196/25933.

[6] K. Lister, T. Coughlan, F. Iniesto, N. Freear, and P. Devine, “Accessible conversational user interfaces,” in Proceedings of the 17th International Web for All Conference, New York, NY, USA: ACM, Apr. 2020, pp. 1–11. doi: 10.1145/3371300.3383343.

[7] F. Khan, Y. Wu, J. Dray, B. Hemsley, and A. B. Kocaballi, “Conversational Agents to Support People with Communication Disability: A Co-design Study with Speech Pathologists,” in Proceedings of the Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, New York, NY, USA: ACM, Apr. 2025, pp. 1–9. doi: 10.1145/3706599.3719800.

[8] F. J. Espinoza-Santacruz and C. H. Flores-Urgiles, “Aplicación de tecnologías de la información en el desarrollo del lenguaje de niños con dificultades de comunicación,” Polo del Conocimiento, vol. 4, no. 5, p. 116, May 2019, doi: 10.23857/pc.v4i5.968.

[9] N. E. Garcia Rivas, “Tecnología Asistiva para la Inclusión Educativa en Ecuador,” Ciencia Latina Revista Científica Multidisciplinar, vol. 8, no. 3, pp. 417–433, May 2024, doi: 10.37811/cl_rcm.v8i3.11228.

[10] B. Roy, S. Ghosh, S. K. Sarkar, A. Sen, and N. R. Choudhury, “Implications of Artificial Intelligence for Special Education Technology,” 2024, pp. 401–430. doi: 10.4018/979-8-3693-5538-1.ch015.

[11] M. Mahmoudi-Dehaki and N. Nasr-Esfahani, “Artificial Intelligence (AI) in Special Education,” 2024, pp. 193–222. doi: 10.4018/979-8-3693-5538-1.ch007.

[12] X. Vélez-Calvo, V. Calle-Calle, C. Seade-Mejía, and M. J. Peñaherrera-Vélez, “Doble excepcionalidad: altas capacidades y trastornos del neurodesarrollo. prevalencia en escolares ecuatorianos,” CienciAmérica, vol. 12, no. 1, Jan. 2023, doi: 10.33210/ca.v12i1.393.

[13] G. A. Attwell, K. E. Bennin, and B. Tekinerdogan, “A Systematic Review of Online Speech Therapy Systems for Intervention in Childhood Speech Communication Disorders,” Sensors, vol. 22, no. 24, p. 9713, Dec. 2022, doi: 10.3390/s22249713.

[14] Z. Brahmi, M. Mahyoob, M. Al-Sarem, J. Algaraady, K. Bousselmi, and A. Alblwi, “Exploring the Role of Machine Learning in Diagnosing and Treating Speech Disorders: A Systematic Literature Review,” Psychol Res Behav Manag, vol. Volume 17, pp. 2205–2232, May 2024, doi: 10.2147/PRBM.S460283.

[15] K. I. Arce-Ruelas, O. Alvarez-Xochihua, J. A. Gonzalez-Fraga, E. Martinez-Martinez, and P. Paez-Manjarrez, “Design and Evaluation of a Spanish Language Therapy Support System,” Journal of Language Teaching and Research, vol. 12, no. 6, pp. 853–863, Nov. 2021, doi: 10.17507/jltr.1206.01.

[16] J. Vonessen, N. B. Aoki, M. Cohn, and G. Zellou, “Comparing perception of L1 and L2 English by human listeners and machines: Effect of interlocutor adaptations,” J Acoust Soc Am, vol. 155, no. 5, pp. 3060–3070, May 2024, doi: 10.1121/10.0025930.

[17] Q. Yang, “Toward Responsible AI: An Overview of Federated Learning for User-centered Privacy-preserving Computing,” ACM Trans Interact Intell Syst, vol. 11, no. 3–4, pp. 1–22, Dec. 2021, doi: 10.1145/3485875.

[18] D. Jiang et al., “A GDPR-compliant Ecosystem for Speech Recognition with Transfer, Federated, and Evolutionary Learning,” ACM Trans Intell Syst Technol, vol. 12, no. 3, pp. 1–19, Jun. 2021, doi: 10.1145/3447687.

[19] R. Lakshminarayanan, A. Shaik, and A. Balasundaram, “Automated speech therapy through personalized pronunciation correction using reinforcement learning and large language models,” Results in Engineering, vol. 25, p. 103943, Mar. 2025, doi: 10.1016/j.rineng.2025.103943.

[20] C. Song, S.-Y. Shin, and K.-S. Shin, “Optimizing Foreign Language Learning in Virtual Reality: A Comprehensive Theoretical Framework Based on Constructivism and Cognitive Load Theory (VR-CCL),” Applied Sciences, vol. 13, no. 23, p. 12557, Nov. 2023, doi: 10.3390/app132312557.

[21] G. A. Ikhimwin, “Dynamic Interactive Multimodal Speech (DIMS) Framework,” Frontiers in Global Health Sciences, pp. 1–13, Jan. 2023, doi: 10.70560/1s1ky152.

Publicado

2025-08-13

Cómo citar

[1]
L. González-Franco and J. Sánchez-Calderón, “Traductor de voz basado en procesamiento de lenguaje natural para asistencia a niños y jóvenes con dislalia”, Revista Digital Científica Causalidad (caui3), vol. 1, no. 2, pp. 15–25, Aug. 2025, doi: 10.70929/caui3.v1i2.0012.