Skip to main content

ETHNOS_APP

Home • Search • Journals • List 0

The power of multimodality

Improving speech act classification through visual cues, audio intonation, and gaze tracking

Bibliographic Data

ID21500664
AuthorsYing Li (0000-0003-0678-9535, Guizhou University, corresponding author), Wari Wongwaropakorn (0000-0003-1263-3182, Walailak University)
Year2025
Publication date2025-08-06
Peer ReviewedYes
Open AccessYes
TypeARTICLE
VenueInformation Development (JOURNAL)
Journal identifiersISSN: 0266-6669 • E-ISSN: 1741-6469
PublisherSAGE Publications (PUBLISHER • US)
DOI10.1177/02666669251355940
OpenAlexW4413004302
LanguageEN
References cited33

Multimodal discourse analysis enhances precision and contextual understanding in speech acts by integrating modalities such as visual cues, text, non-verbal signals, and gaze tracking. This study explores the effectiveness of multimodal discourse in improving speech act classification through combined visual, auditory, and non-verbal data. A mixed-method approach was employed, involving quantitative data from 370 communication professionals analyzed using Statistical Package For Social Sciences (SPSS), alongside qualitative insights from interviews and focus groups. Findings indicate that visual cues significantly enhance speech act classification performance, while audio intonation improves accuracy under noisy conditions. The integration of text and non-verbal data further supports deeper contextual understanding, particularly benefiting indirect speech act recognition and overall multimodal fusion effectiveness. This study's holistic approach uniquely combines multiple modalities, visual, audio, text, and gaze tracking, surpassing previous research focused on isolated speech interpretation factors. Multimodality significantly improves accuracy and contextual comprehension in speech act classification, demonstrating that communication analysis should extend beyond textual content to include audio and non-verbal traits for a fuller understanding

Audio visual · Eye tracking · Gaze · Linguistics · Multimedia · Multimodality · Speech recognition · World Wide Web · Computer Science · Hearing Impairment and Communication · Language, Metaphor, and Cognition · Subtitles and Audiovisual Media · Artificial Intelligence

  • Semiotic modes accentuating learners’ metafunctions

    Azza A M Abdelrahim•Southern African Linguistics and…•2024

  • Discursive de/humanizing

    Open Access•Ruth M López•Education Policy Analysis Archives•2020

  • A multimodal discourse analysis of English dentistry texts written by Saudi undergraduate students

    Open Access•Hesham Suleiman Alyousef•Open Linguistics•2020

  • Developing multimodal communicative competence in emerging academic and professional genres

    Open Access•Noelia Ruiz-Madrid, Julia Valeiras-Jurado et al.•International Journal of English…•2020

  • Signs of understanding and turns-as-actions

    Open Access•Elisabetta Adami, Ruth Swanwick•Visual Communication•2019

  • Do political cartoons and illustrations have their own specialized forms for warnings, threats, and the like? Speech acts in the nonverbal mode

    Ahmed Abdel-Raheem•Social Semiotics•2020

  • Multimodal constructions revisited. Testing the strength of association between spoken and non-spoken features of Tell me about it

    Open Access•Claudia Lehmann•Cognitive Linguistics•2024

  • Eye gaze and viewpoint in multimodal interaction management

    Open Access•Geert Brône, Bert Oben et al.•Cognitive Linguistics•2017

  • Sámi tourism in marketing material

    Open Access•Cecilia de Bernardi•Acta Borealia•2022

  • Speech Act Theory

    Open Access•C Levinson, Stephen C Levinson•Language Teaching•1980

  • Multimodal Coordination of Sound and Movement in Music and Speech

    Camila Alviar, Rick Dale et al.•Discourse Processes•2020

  • A Corpus Study on the Difference of Turn-Taking in Online Audio, Online Video, and Face-to-Face Conversation

    Open Access•Ying Tian, Tian Ying et al.•Language and Speech•2024

Citation velocityhistorical
Highly citedNo

Tools

Open DOI
Ethnos_APP • Open Source Project • MIT License • Frontend v2.0.0 • Privacy and Cookies • API Documentation: api.ethnos.app/docs • API Source Code: GitHub • DOI: 10.5281/zenodo.17049435 • Frontend Source Code: GitHub • DOI: 10.5281/zenodo.17050053 • cruz.rio.br • Expectantes Misericordiae