28th ACM International Conference on Multimodal Interaction
(5-9 October 2026)

Context and Cultural Awareness for Multimodal Interaction

Home

Registration

Important dates

Keynote Speakers

Conference Center

Conference Program

Grand Challenges

Special Sessions

Workshops

Call for Sponsors

Tutorials

Call for Papers

Call for Blue Sky Papers

Call for Demos

Doctoral Consortium

Late-Breaking Results

Author Guidelines

Reviewer Guidelines

Camera Ready Instructions

About Naples

Visa Information

Accommodation

Social Activities

Travel

People

Steering Committee

Reviewers

Technical Program Committee

Platinum Sponsor
Gold Sponsors
blank
Bronze Sponsor
blank
blank
LOGO_Innovaway
LOGO_Innovaway
Blue Sky Sponsor
blank
Institutional Sponsor
blank
blank
social ai

Sessions

 

Main Conference Day 1 – Tuesday, 6 October 2026

10:00-11:00 Poster Session #1: Affective Computing, Health & Wellbeing

Affect-Aware Game Personalization with Reinforcement Learning: How to Improve Players’ Engagement, Performance, and Emotions
Mahyar Tourchi Moghaddam, Tiziano Santilli, Mina Alipour

A Screening Method for Children with Autism Spectrum Disorder Based on a Dual-Stream, Multi-Scale, Cross-Modal Attention Mechanism
Haoran Sun, Bang Li, Xiaoqing Jiang, Liu Chen, Shengduo Hu, Chenyang Liang, Jianwei Gu, Kaiyun Li, Zhenxiang Chen

Multimodal Biomarkers of Dysarthria: Severity-Conditioned Contrastive Alignment of Speech, Text, and Facial Asymmetry
Karen Rosero, Chi-Chun Lee, Rami R. Hallac, Carlos Busso

Self-Supervised Dual-Stream Temporal Learning for Neonatal Pain Estimation
Muhammad Suhaib Shahid, Michel Valstar, Don Sharkey, Joy Egede

From Feedback to Neural Dynamics: Network-Based Modeling of EEG in Interactive Tasks
Behdokht Kiafar, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

Multi-Scale Spatiotemporal EEG and Self-Supervised Audio Fusion: A Mixture-of-Experts Approach to Continuous Affect
Ali Amini, Sarmad Maqsood, Irfan Abbas, Muhammad Abdullah Sarwar, Rytis Maskeliūnas, Robertas Damaševičius

From Facial Expressions to Emotional Health: Deploying Affective Computing in Call Centers
Lesly Nzeusseu Kouamou, Pierrich Plusquellec

Correcting in the Moment: Evaluating Real-Time AI Postural Feedback for Cellists
Paolo Wang, Kexin Sha, Kunzhu Xie, Michael Zhang, Shrinand Perumal, Ekaterina Tszyao, Jackson Shields, Luke Choi, Sivamurugan Velmurugan, Preston Mo, Daniel Chindris, Wangyue Xue, Mohammad Rahman, Ming Yin, Zhenyu Cheryl Qian, Yingjie Victor Chen, Ka-wai Yu, Yung-Hsiang Lu, Kristen Yeon-Ji Yun

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment
Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

Breathing Signal Prediction from Speech: Toward Reproducible and Comparable Models
Francisca Pessanha, Glenn de Wildt, Alexis Deighton MacIntyre, Heysem Kaya, Almila Akdag

Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating
Yuriko Kikuchi, Takato Hayashi, Ryusei Kimura, Naoya Inoue, Ryo Ishii, Shogo Okada

From Signals to Connection: Exploring Physiological Markers of Human–Nature Connectedness
Olivia Brunet, Romain Grandchamp, Benoît Fernandez, Gladys Barragan-Jason, Axel Carlier

Light-ED: Lightweight Multimodal Emotion Detection using Enhanced EfficientNet
Wamika Jha, Mea Wang, Usman Alim, Zoe Kirsman

Unmasking Suppressed Emotion: A Multi-Agent Approach to Affective Dissonance
Chenghong Lin, Tochukwu Eze, Dawei Xie, Khalil J Anderson, Bookyung Shin, Marcelo Worsley

Multimodal Behavioral Typicality as a Training-Free Screening Signal for Dementia
Leticia Pinto-Alva, Gale Lucas, Maja J Matarić, Jesse Thomason

Who, Where, How Matters: Evaluating Emotion Recognition under Context Shifts
Sayak Mukherjee, Tom Viering, Bernd Dudzik

A Unified Tokenization Framework for Pain Recognition using Heterogeneous 3D Modalities
Stefanos Gkikas, Christian Arzate Cruz, Valentina Becchetti, Muhammad Umar Khan, Alessandro Giuseppi, Raul Fernandez Rojas

Autism Screening via Pose Kinematics and Shallow Graph Embedding for Small-Sample Dyadic Imitative Interaction
Bang Li, Zhenxiang Chen, Haoran Sun, Xiaoqing Jiang, Jianwei Gu, Chenyang Liang, Shengduo Hu, Kaiyun Li

11:00-12:30 Oral Session #1: Conversational AI, Speech & Avatars

11:00 HAAS: Holistic Attention-free Animation from Speech using Mamba
Laxmi Narayen Nagarajan Venkatesan, Harsh Vardhan Singh, Vansh Sinha, Sai Madhavan G, Subhajeet Lahiri, Rahulraj B R, Vaishnavi Josyula, Dinesh Babu Jayagopi, Raj Tumuluri, Magnus Revang, Ajai Devanathan

11:15 TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations With Young Adults
Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor

11:30 Unleashing Chain-of-Thought Style Reasoning for Text-to-Speech Systems
Ziyue Jiang, Zhou Zhao

11:45 Conversational Facial Dynamics as Behavioral Identity Signals: From Naturalistic Conversations to Avatar-Mediated Communication
Masoumeh Chapariniya, Pierre Vuillecard, Jean-Marc Odobez, Volker Dellwo, Teodora Vukovic

12:00 AFA: Identity-Aware Memory for Preventing Persona Confusion in Multi-User Dialogue
Mohammad Al-Ratrout, Pavan Uttej Ravva, Shayla Sharmin, Aditya Raikwar, Ju Young Shin, Roghayeh Leila Barmaki

12:15 Towards a Voice Design Tool to Support Game Masters of Tabletop Role-Playing Games
Laura Kanschat, Johanna Kuch, Daksitha Senel Withanage Don, Niklas Heimerl, Silvan Mertes, Elisabeth André

14:00-15:00 Special Session: Multimodal Sensing and Interventions for Mental Well-being

14:00 Multimodal Anxiety Detection with Adaptive Hyperbolic Few-Shot Learning
Aditya Sneh, Nilesh Kumar Sahu, Anushka Sanjay Shelke, Arya Adyasha, Haroon R. Lone

14:15 Modeling Affective Distress from Video: A Modality-Aware Multi-Branch Learning Approach
Om Govind Jha, Nilesh Kumar Sahu, Haroon R. Lone

14:30 Multimodal features for multi-perspective assessment of working alliance in therapist-patient psychotherapy
Rivka Vollebregt, Lennard René Bornemann, Sanne J.E. Bruijniks, Albert Ali Salah

14:45 “Why does the computer say I am depressed?” Towards a better understanding of concepts in automatic depression detection
Sytse Backx, Stan Meyberg, Gizem Sogancioglu, Heysem Kaya

15:00-16:30 Poster Session #2: Social Interaction, Dialogue & Human–AI Interaction

Takes Two to Know One: An Approach for Personality Prediction from Dyadic Conversation Based on Text
Zijie (Jack) Zhou, Siyuan Chen

Real-time Multimodal Addressee Detection in Multi-party Dialogue
Divesh Lala, Koji Inoue, Taiga Mori, Tatsuya Kawahara

I Don’t Always Do What I Am Told: The Case for Task Incongruence-Aware Systems for Technology-Supported Reflection on Social Interactions
Chenxu Hao, Tiffany Matej Hrkalovic, Bernd Dudzik, Hayley Hung

The Role of Language Understanding in Speech-Based Multimodal Automatic Personality Perception
Nisreen Alshubaily, Emily O’Hara, Tanaya Guha, Alessandro Vinciarelli

Binaural Speech and Distribution Learning for Predicting Auditory Distance Perception in Audio Augmented Reality
Sahar Altalhi, Tanaya Guha, Alessandro Vinciarelli

Multimodal Rapport Estimation in Real-World HRI
Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

Automated Behavioural Analysis in Parent-Infant Interactions using Multimodal-Large-Language Models
Daksitha Senel Withanage Don, Tobias Hallmen, Mitho Müller, Lea Kaubisch, Linda Stürmlinger, Yaren Günay, Anna-Lena Zietlow, Beate Ditzen, Johannes C. Ehrenthal, Cristina Luna-Jiménez, Prof. Dr. Corinna Reck, Elisabeth André

HARMONI: Multimodal Personalization of Multi-User Human-Robot Interactions with LLMs
Jeanne Malecot, Hamed Rahimi, Jeanne Cattoni, Marie Samson, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani

Multimodal Behavioural Indicators of Social Performance in Collaborative Problem Solving
Jennifer Hamet Bagnou, Amine Benamara, Céline Clavel, Jean-Claude Martin, Elise Prigent

“Great! The Next Step Is…”: In Pursuit of Proactive Assistance with Multimodal Foundation Models
Sean Andrist, Dan Bohus, Maia Stiber, Yuwei Bao, Tim Schoonbeek, Eric Horvitz

Beyond Rhythm and Prosody: Inter-Utterance Silence Predicts Drone Movement Duration in Spontaneous Vocal Guidance
Allan Henry, Solange Rossato, Christian Graff, Sylvain Huet, Jose-Ernesto Gomez-Balderas

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios
Thai Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue
Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell

Impact of Adaptive Feedback in Multimodal Human-Agent Interaction
Shaid Hasan, Sujan Sarker, Tariq Iqbal

Big5-HCD: A Human-Computer Dialogue Benchmark with Personality Annotations via Semi-Supervised Adaptation
Weidong Zhang, Haifeng Guo, Weiming Wang, Haoran Xie, Fu Lee Wang

Clustering Co-Speech Gestures Using Morphological Representations
Simbarashe Nyatsanga, Huanjie Dong, Ikhsanul Habibie, Christian Theobalt, Michael Neff

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach
Ha Anh Ngo, Nicolas Rollet, Catherine Pelachaud, Chloe Clavel

Joint Attention Modeling in Naturalistic Interactions with Social Gaze and Proximity Cues
Miranda Dickerman, Michael Villamizar, Sabine Stoll, Jean-Marc Odobez

Facial Expressions and Gaze Behavior Patterns During a Collaborative Board Game
Amine Benamara, Céline Clavel, Brian Ravenet, Nicolas Sabouret, Julien Saunier

Speaker Diarization in Static and Egocentric Videos via Speech-Face Alignment
Zeyang Zhang, Xavier Yin, Zhaobo Zheng, Kumar Akash, Teruhisa Misu, Carlos Busso

Deception Detection Across Diverse Interaction Contexts: A Progressive Transfer Learning Approach
Abdullah Alzahrani, Eve Gittins, Muneeb Ahmad

Validation of a Multi-level Self-Report Rapport Scale and its Impact on Multimodal Modeling of Small Group Interaction
Justine Reverdy, Oussama Silem, Justine Cassell

Real-time Generation of Listener Nodding via Prediction of Kinematic Parameters for Avatar Dialogue Systems
Kazushi Kato, Koji Inoue, Taiga Mori, Divesh Lala, Tatsuya Kawahara

Defining “Neutral” Agents: A Critical Review and Future Guidelines
Emma Jane Pretty, Weichen Li, Anna-Leena Macey, Nannan Xi, Juho Hamari

Code-to-Speech: An Exploratory Study of AI Text-to-Speech for Source Code Readability
Marco Cardia, Letizia Angileri, Marina Buzzi, Barbara Leporini

CoRead: Using Implicit Behavioural Signals for Mixed-Initiative AI Support in Collaborative Academic Reading
Sakil Sarker, Yasaman A.Basti, Heidar Davoudi, Ali Neshati

NVFCorpus: A Corpus for Analyzing Multimodal and Multifunctional Nonverbal Behavior in Multiparty Conversations
Kazuhiro Otsuka, Takumi Nishihira, Yuya Nishimura, Issa Tamura

16:30-18:00 Oral Session #2: Emotion, Affect & Well-being

16:30 Smiling Regulates Emotion During Traumatic Recollection
Marcus Ma, Emily Zhou, Leonard Ludwig, Julia Hörath, Christina Winkler, Kleanthis Avramidis, Tiantian Feng, Gabor Mihaly Toth, Alina Bothe, Shrikanth Narayanan

16:45 Hierarchical Quantized Cross-modal Masked Autoencoders for Audio-Visual Emotion Recognition
Zeyang Zhang, Carlos Busso

17:00 MindBeat: A Multimodal Interface for Stress Recovery through Rhythmic Fidgeting
Wenjie Xu, Ziang Xu, Rui Zhang, Qinjie Wang, Fangtian Ying

17:15 Beyond Surveys: Predicting Student Well-being from Open-ended Video Responses using LLMs
Thu Bui, Minjun Choi, Shifa Somji, Hillary Merzdorf, Nan Kong, Louis Tay, Sooyeon Jeong

17:30 Interoception-Inspired Emotion Estimation via Intrinsic Diffuseness-Guided Learning
Haifeng Zhang, Von Ralph Dane Marquez Herbuela, Yukie Nagai

17:45 EmotiStage: Designing an Emotion-Driven Performance System with Multi-modal Generative AI to Support Emotional Awareness
Ziying Wang, Yihong Lin, Xianglin Zhao, Yirui Huang, Ziya Zhou, Wei Xue, Wanling Cai, Yucheng Jin

18:00-18:30 Challenge Overview

Main Conference Day 2 – Wednesday, 7 October 2026

10:00-11:00 Demo, DC

Demonstrations

AUGI: Multimodal Gestural and Tactile Control for Acoustic Wind and Brass Instruments
Susan E Green-Mateu, Jackson Tallamy, Kyle Hutchins

BuddyBack: A Multimodal Smart Posture Correction System
Federico Raponi, Marco Realacci, Lorenzo Spataro, Danilo Avola, Maurizio Mancini, Emanuele Panizzi

ConceptLens: Interactive Concept Bottlenecks for Black-Box Models
Hasan Md Tusfiqur Alam, Abdulrahman Mohamed Selim, László Kopácsi, Daniel Sonntag

Embodying Luca Giordano: A RAG-Grounded Context-Aware Robot for Cultural Heritage Storytelling
Mario Barbato, Marco Grazioso, Martina Di Bratto, Azzurra Mancini, Valentina Russo, Silvia Rossi

Emotional Echoes: A Spatialized VR Gallery for Revisiting and Reinterpreting Emotional Memory
Yao Liu, Marina Carulli, Monica Bordegoni

FLIDIS: An Experimental Infrastructure for Dual-Task Research in Continuous Control and Multimodal Interaction
Charles O Njoku, James Blundell

MULTIDATA: An Interactive Web Platform for Speech-Gesture Data Extraction and Visualization
Raúl Sánchez, Daniel Alcaraz Carrión, Irene Bolumar Martínez, Armine Garibyan, Yassine Iabdounane, Mark Turner, Peter Uhrig, Cristóbal Pagán Cánovas

Vibrotactile Feedback for Accessible Audio Production: Demonstrating HAPCI and HFAM
James Hurley, Jon Drummond, Bert Bongers

Windborne: Fostering Nature Connection and Playfulness through Multimodal Interaction in Healthcare Settings
Borui Wang, Keith Evan Green

Doctoral Consortium Posters

Multimodal Modeling of Microsurgery Training Assessment
Ayobami Oyewole

Towards Memory-Aware Adaptive Agents
Deborah van Sinttruije

Buzz, Bid, Body: Multimodal Practices of Distributed Recognition
Pipob Puthipiroj

Generic modeling of Human-Machine Interaction
lykong un

Multimodal detection and classification of humor in human-human and human-machine interactions
Sofia Callejas

Structured Representations For Human-Robot Interaction with Non-Expert Users
Valerie K. Chen

What Matters Over Time: Temporal Properties of Non-Verbal Signals for Intent Recognition in Human–Robot Interaction
Eunyoung Hwang, Alessandra Rossi, Silvia Rossi

Designing Multimodal Conversational AI for Longitudinal Well-Being Monitoring
Thu Bui

Socially Interactive Agent for Group Debate Mediation
Nahuel Gómez

FAU-Preserving Video Anonymization for Privacy-Aware Reproducible Research
Sophin Chheng

Multimodal Subjective Intention Modeling in Social Interactions
Arthur Mercier

11:00-12:30 Oral Session #3: Neurophysiological & Wearable Multimodal Sensing

11:00 Multimodal Learner-State Analytics: Cross-Modal Insights from Motor-expressions and EEG for Instructor-Facing Visualization Platform
Qi Song, Gaoyuan Zhang, Chengchen Lyu, Xurong Xie, Naiming Yao, Hui Chen, Feng Tian

11:15 μDPad: A Large-Scale Multimodal PPG and IMU Dataset for Wrist-Worn Microgesture Recognition
Lars Hauptmann, Dominik Hollidt, Xintong Liu, Manuel Meier, Christian Holz

11:30 MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis
Yuanhao Chen, Peter Chin

11:45 SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval
Akshaj Murhekar, Christina Liu, Abhijit Mishra, Shounak Roychowdhury, Jacek Gwizdka

12:00 Investigating Foundation Models, Disentanglement and Latent Alignment for Subject-Independent EEG Learning
Lia Schmid, Jacopo Burger, Alessandro D’Amelio, Raffaella Lanzarotti

12:15 MIMIC: A Real-Time Multimodal Framework to Provide Fine-Grained Motion Corrections Remotely
Blain Judkins, Jennifer Yentes, Edgar Javier Rojas-Muñoz

14:00-15:00 Blue Sky Papers

14:00 Human Hardware in an Agentic World: Jia’s Journey as a Biological Actuator and the Call for Sovereign Interaction Design
Lik-Hang Lee

14:20 The Person Multimodal AI Cannot Finish
Mohammad Rashedul Hasan

14:40 The Recognition-Consequence Gap: How Gesture Recognition Misses Human Action
Stephanie A Scopelitis, Dane DeSutter

15:00-16:30 Poster Session #3: Multimodal Learning, Vision-Language Models & Responsible AI

GRoFA: Noise-Gated Adapters for Jointly Fair and Robust Face Embeddings
Amu Suemoto, Yutaka Arakawa, Tsunenori Mine

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal Assembly Assistants
Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata
Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

Bridging the Spatial Blind Spot in Pathology Foundation Models for Tumor Localization
Guoshuai Xu, Kai Zhang

STACK: 3D Spatial Task Analysis in Collaborative Construction Keyframes
Changsoo Jung, Sheikh Abdul Mannan, Jack Fitzgerald, Ethan Seefried, Videep Venkatesha, Sifatul Anindho, Nathaniel Blanchard

NewsSegCap: Efficient Dense Video Captioning for TV News
Antoine Brimont, Titus Zaharia, Ruxandra Tapu

TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
Yuliang Cai, Jesse Thomason, Mohammad Rostami

When Cross-Modal Attention Fails under Channel Degradation: Diagnosing Dominant Interaction Structure for Reliable Multimodal Interaction
Bin Liu, Zhaoxiang Xiao, Zhengpeng Liu

Distilling the Noise: Value-Aware Contrastive Hypergraph Learning for Robust Multimodal Rumor Detection
Heng Zhang, Weiyu Zhang, Chaoqun Zheng, Rui Wang, Jiasheng Si, Wenpeng Lu, Deyu Zhou

Self-Distillation as a Structure-Dependent Mechanism in Multimodal Dialogue via Multi-Context Modeling
Ryo Ishii, Chihiro Takayama, Jiro Nagao, Toshiki Onishi, Yukiko Nakano, Junichi Sawase

Human-Centered Metrics for Evaluating Usability in Artificial Intelligence Generated Human Object Interactions
Shengdi Xiao, Yuto Asano, Jingjing Li, Yoichi Ochiai

Towards Gaze-Informed AI Disclosure Interfaces: Eye-Tracking Attentional and Cognitive Load While Reading AI-Assisted News
Pooja Prajod, Hannes Cools, Thomas Röggla, Pablo Cesar, Abdallah El Ali

SIGMA: Statistical Memory Head for Robust Class-Incremental Vision–Language Learning with CLIP
Dinh-Dat Nguyen, Duc-Duy Mai, Hung Xuan Ho Mr, Quynh-Trang Pham Thi, Thanh-Hai Dang

M3CA: Multi-modal and Multi-view Fusion based on Multi-layer Cross Attention for Isolated Sign Language Recognition
Jinyang Feng, Zhong Guan, Yongli Hu, Jiahai Yang

An Explainable Neurosymbolic Multimodal Deepfake Detection with A Comparative Study of Cross-Dataset Generalization
Md Shafiqul Baten Sumon, Fatma Najar

From Bytes to Semantics: LLM-Agent-Driven Commit Message Generation for Non-Code Assets
Liran Wang, Zhoujun Li

HuGDAT: Guiding Transformer Attention with Human Vision
Ahmad Waseem, Pietro Ruiu, Andrea Lagorio, Seth Nixon, Massimo Tistarelli

Local Optical Flow for Eye Movement Event Detection in Head-Mounted Setups
Abdulrahman Mohamed Selim, Omair Shahzad Bhatti, Lukas Wilde, Khue Minh Pham, Michael Barz, Daniel Sonntag

Towards Responsible AI in Low-Resource Languages: Evaluating LLM Responses with a Culturally Aware Sinhala Dataset
Liyanaarachchige Dona Rashmi Nirasha Gunawardana, Ayantha Randika, Dushani Perera, Kasun Karunanayaka

ADMC: Attention-based Diffusion model for Missing modalities Completion
Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, En Zhu, Liangze Yin

TraceNote: Instructor Cursor Dynamics as Spatiotemporal Signals for Importance-Aware Lecture Note Generation
Yao Tong, Su Wang

ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Slide Refinement
Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao

EST-inspired computational approaches to event boundary detection
Amirarsalan Serajoddin Mirghaed, Gualtiero Volpe, Giovanna Varni

Pre-processing Techniques for Multimodal Affective Computing: Implications for Data Quality and Multimodal Fusion
Célio Carvalho, José Torres, Rui Silva Moreira

GroundingGaze: An Interactive Pipeline for Automatic Gaze Annotation
Mounika Kanakanti, Ferdinand Otmar Paar F.P., Asli Ozyurek, Chinmaya Mishra

16:30-18:00 Oral Session #4: Engagement, Behavior & Human State Modeling

16:30 Interpretable Multimodal Engagement Prediction with Graph-based Mixture-of-Experts
Monisha Singh, Abhinav Dhall

16:45 From Detection to Mechanism Analysis: Interpretable Multimodal Concept Interactions in Gesture Pragmatics
Jinqian Zhang, Sixia Li, Candy Olivia Mawalim, Shogo Okada

17:00 Self-Supervised Representation Learning for Heterogeneous Behavioral Expressions of Social Engagement
Naga Venkata Sai Raviteja Chappa, Lisa Yankowitz, Gokul M Nair, Evangelos Sariyanidi, Casey J. Zampella, Kathleen Campbell, Whitney Guthrie, John D. Herrington, Robert T. Schultz, Birkan Tunc

17:15 Human-as-a-Sensor: Inferring Individual Engagement from Teammates Alone via Latent Group State Modeling
Zhaobo Zheng, Navid Salami Pargoo, Kumar Akash, Teruhisa Misu

17:30 How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks
Tahiya Chowdhury

17:45 SQUAD: A Unified Framework for 3D Dyadic Scene Understanding with Applications to Visual Focus of Attention and Object Use
Berfu Karaca, Niilo V. Valtakari, Albert Ali Salah, Jaap J. A. Denissen, Sonja M. C. de Zwarte, Ronald Poppe

Main Conference Day 3 – Thursday, 8 October 2026

10:00-11:00 Poster Session #4: XR, Embodied Interaction & Multimodal Interfaces

Quantifying 3D Pointing: Characterizing What Happens During Pointing Selection in Virtual Reality
Junhan Kong, Jacqui Fashimpaur, Michael J Proulx, Hemant Bhaskar Surale, Jacob O. Wobbrock, Amy Karlson

Did I Just Cheer in a Concert Hall?: Enhancing Remote Participation with Congruent Self-Voice Feedback
Hikari Kato, Tomoaki Konno, Toshiharu Horiuchi

XRPoseSync: A Synchronized Multimodal Dataset for EdgeXR Pose Prediction
Ziyu Zhong, Jens Nirme, Hector A Caltenco, Stefan Lindgren, Björn Landfeldt

TriSelect: Distance Adaptive Multimodal Object Selection in Virtual Reality Using Eye Gaze, Hand Gesture, and Voice
Jai Sachdeva, Prashant Rawat

Partner Representation Shapes Coordination Tradeoffs in Shared XR
Ehtisham Ul Haq, Robert S. Allison, Laurie M Wilcox

Hands-VRee: Towards Hands-Free Gaming in VR via Concurrent Input for Locomotion, Viewport Control, and Pointing
Adrian Javier Leon Valencia, Pedro Tavares, Inês Alves, Ian Oakley, Augusto Esteves

IntentVLM: Open-Vocabulary Intention Recognition through Forward–Inverse Modeling with Video-Language Models
Hamed Rahimi, Clémence Grislain, Adrien Jacquet Crétides, Olivier Sigaud, Mohamed Chetouani

Disrupted Harmony: How Visual–Audio Incongruence Influences Creativity in Collage Making
Leyan Wu, Yalong Luo, Andi Wan, Yucheng Jin

Han-Vibe: Culturally-Situated Multimodal Interaction for AI-Mediated Live Music Performance
Zhengyang Ma

Audiovisual Material Perception in Virtual Reality
Harshitha Koppisetty, Laurie M Wilcox, Robert S. Allison

Multimodal User Simulation with Cross-Modal Grounding for Virtual Museum Interaction
Shreya Sanghamitra, Shihan Wang, Shenghui Wang

What you know, How you act: Transactional VR Authentication
Numan Zafar, Shafique A Chaudhry

Pose-to-Command: A Personalized Embodied Control Layer for Ordinary Games
Tung Khau, Matthias Rueger, Gerrit Meixner

Exploring Thermal Color Cues to Evoke Thermal Illusions in Virtual Object and Hand-to-Hand Interactions in VR
Artem Sultanov, Alexander Raake, Stephanie Arevalo Arboleda

Inferring Openness to Experience from Behavioral Signals in a Virtual Reality Art Gallery
Aaditya Vardhan Narain, Raman Saxena, Y. Raghu Reddy

Causal Temporal Padding for Low-Latency Real-Time Gesture Generation
Ryo Ishii, Shinichiro Eitoku, Jiro Nagao, Junichi Sawase

Auditory Feedback as a Communication Modality: Modeling Perceived Semantic Expression of UX Sounds
Annika Frommholz, Steffen Lepa, Stefan Weinzierl, Johannes Helberger

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models
Eu Jin Lim, Zhaoxing Li, Sebastian Stein

11:00-12:30 Oral Session #5: Multimodal Reasoning, Explainability & Methods

11:00 DatasetOS: An Agentic Framework For Multimodal Dataset Construction
Bashayer Alsreidi, Ghaleb Aldoboni, Lobna Nassar, Fakhreddine Karray

11:15 Explanation Needs Emerge Before Explicit Requests in Human-Robot Interaction
Dimosthenis Kontogiorgos, Joakim Gustafson, Julie Shah

11:30 S-AODP++: Structure-Aware AOI-Guided Scanpath Attention for AI-Generated Image Identification
Jingming Wang, Renwei Meng, Yunjie Si

11:45 SPICE: Synergy and Partial Information Based Curriculum Evolution
Ankush Pratap Singh, Houwei Cao, Yong Liu

12:00 Scene-Conditioned Capability Mounting as a Visible and Executable Boundary for Situated LLM Agents
Siyu Jiang, Yuxuan Cheng, Jiayi Wang, Sanshuai Cui

12:15 MapQA: A Map-Question-Answering Benchmark for Visual Language Model Reasoning
Christian Arnold, Andrew Alini, Abdulrahman Alabdulkareem, Jonathan Wang, Pieter Feenstra, Conner Arnold, Jan Kenneth DeWitt, Natalie Christina Ritsema, Jung Hyun Yae, Boris Katz, Andrei Barbu, Brian Cheung

15:00-16:30 LBR

How Local AI Framing Shapes User Experience and Perceived Data Security with an Embodied AI Psychotherapist in VR
Paula Friedrich, Lukas Polifke, David Obremski, Marc Erich Latoschik, Carolin Wienrich

A Clinical Decision Support System Prototype for Multimodal Youth Mental Health Monitoring
Carlo Mazzola, Helen Stocks, Ula Kolinska, Izidor Mlakar, Gwendolyn Mayer, Zouhair Haddi

Designing a Functional Social Robot for Blood Test Procedures in the Emergency Department: A Human-Centered Approach
Yuval Rubin Kopelman, Dikla Dahan Shriki, Zohar Fein, Mahmod Hamdan, Rony Ben Ami, Daniel Armoni, Andrey Grishko, Nevo Heimann Saadon, Hadas Erel

“Nobody Told me Farming is not Only Farming”: A Conversational AI Agent for Causal Loop Reasoning with Japan Farmers
Tomohide Mizuuchi, Eduardo Feteira, Liuru Nan, Mami Yoda, Wan-Jou She, Panote Siriaraya

Structured Patterns of Dyadic Motion Coordination Predict Communicative Success
Aditya Mutharasu, Elayna Bowe, James Benjamin Falandays

Benchmarking Prompt Extension and Image Generation Models for Automotive Instructional Imagery
Yuval Zak, Eli Tzirkel

CEMAS – a Configurable Embodied Multi-Agent System
David Obremski, Lukas Polifke, Marc Erich Latoschik, Carolin Wienrich

Emerging Agency-Aware Interface Patterns in AI-in-the-Loop Platforms
Massimo Bertolotti, Silvia Di Giulio, Genoveffa Tortora, Luigi Troiano

How Humans Evaluate Headline-Map Climate Change Misinformation with Multi-Agent (In)consistent Guidance?
Nianhua Liu

Aligning Gaze, Space, and Cognition: A Multimodal Triangulation Framework for Visitor Interactions in Cultural Heritage (An Expert vs. Non-Expert Comparative Study)
Zihe Wei, Yufei Liu, Dan Zhang, Xin Zhang, Miao Sun

How to Greet Humans: Designing Opening Encounters for Functional Robots with Naive Users
Tom Hitron, Nevo Heimann Saadon, Guy Doron, Thomas H. Weisswange, Hadas Erel

Implied Expressive Motions in Paintings: An Early Study on the Limits of Text-to-Motion Generation
Mohammadreza Mahmoudi, Nicola Corbellini, Cora Gasparotti, Nicola Ferrari, Antonio Camurri

Do Emotional Cues Matter? Exploring Support Strategy Selection in LLM-Based Supportive Conversations
Weiyi Tian, Safak Dogan, Jie Meng

Beyond the Vibration Channel: A Signal-Level Benchmark for Dry-Sand Touch on Phones
Takahiro Yamamoto, Toshiharu Igarashi

Continuous wrist kinematics carry lexical cues for temporal deixis
Raúl Sánchez Sánchez, Cristóbal Pagán Cánovas

Does Listening Matter? Backchanneling and Nodding in AI Clone
Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara

An Exploratory Multimodal Analysis of Digital Handwriting and Spontaneous Speech Features to Distinguish Early Cognitive Impairment from Normal Aging
Maria Santina Ler, Maria Sarno, Miriam Veneziano, Gennaro Cordasco, Anna Esposito, Antonio Perna

3D Gaze Ray Dynamics During Palpation-Centered Nursing Assessment of Edema
Masato Fukuda, Mitsuhiro Goto, Koki Ebina, Aya Saitoh, Noriko Yagyuda, Shigekuni Kondo, Sayuri Sakai

Modeling Participant Behavior Across Utterances and Silent Intervals for Engagement Estimation of Individuals with ASD
Hiyori Toda, Jie Zeng, Fumio Nihei, Chihiro Takayama, Ryo Ishii, Masatsugu Tsujii, Yukiko Nakano

A Multimodal Latent State-Space Framework Reveals Spontaneous Interpersonal Synchrony Dynamics
PhD Yubraj Gupta, PhD Stefanie Suttkus, PhD Steffen Schulz, PhD Feliberto de la Cruz, PhD Maria Geisler, Dr Karl-Juergen Baer, PhD Andy Schumann

A Multilingual Speech-Driven Semantic Input Module for University Indoor Wayfinding
Gökhan Ceylan, Gabriella Trasciatti, Emanuele Panizzi

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
Corey DC Heath

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot
Yuki Okafuji, Koji Inoue, Yoshiki Ohira

Explainable AI Insights into Gender-Associated Facial and Upper-Body Patterns in Public Speaking: An Exploratory Study
Nesrine Fourati, Kamel Madi

Is Bad Handwriting Really Bad? Multimodal Human–AI Interpretation of Illegible Handwriting in Palliative Care
Zhigang Ni, Lei Yang

DyadicTickTacking: Multimodal Co-Evolution of Joint Strategies and Turn-Taking in Expert-Novice Scaffolding
Ali KhaliliKandjani, Gabriele Romano, Nicola Corbellini, Gualtiero Volpe

When Coordination Signals Can Mislead: Conversational and Facial Markers of Transactive Functioning in Newly-Formed Virtual-Reality Teams
Tristan Lannuzel, Beatrice Biancardi, Mukesh Barange, Stéphanie Buisine

A Modular Open-Source Augmented Reality Drone Environment for Human–Drone Interaction Research
Vilmer Malm, Hugo Raimer, Javier Jiménez Ruescas, Fanta Camara, Mohammad Obaid

A Reproducible Multimodal LLM-as-a-Judge Workflow for Exploring Epistemic Dissonance
Rei Yuda

Can Vision-Language Models Extract Relevant Multimodal Cues for Post-Inference Cue Integration? A Comparison of Affective Judgments on Adult and Child Interaction Data
Xiajie Zhang, Sharifa Alghowinem, Hae Won Park, Cynthia Breazeal

CreaRobot – Improving creativity using a social robot
Salvatore Maria Anzalone

Towards a Multimodal Video-Based Approach for Editable Piano Score Transcription
Silvia Di Giulio, Luigi Troiano, Genoveffa Tortora

SMILE: A Hybrid Memory-Driven Dialogue Manager for Social Companion Robots
Mariacarla Staffa, Salvatore Maria Anzalone, Lorenzo D’Errico

LLMs with a Heart: Using Contextual Heartbeat Haptics to Add Feeling to Text and Audio LLM Interactions
Prithiv Premkumar, Shuyuan Liu, Ryan Clark, Ken Shibata, Christopher Vaughn Casarez, Bruce N. Walker

Evaluating the Impact of Large Language Model Assistance on Human Attention Paradigm in Human–Robot Collaboration
Tajbeed A. Chowdhury, Jose A. Trapero, Farah I. Corona-Strauss, Daniel J. Strauss

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction
Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility
Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour

16:30-18:00 Oral Session #6: Human–AI Collaboration, Co-Creation & Simulation

16:30 Ethical Guidelines and Stakeholder Perspectives on the Use of Conversational AI in Psychotherapy – A Scoping Review
Paula Friedrich, David Obremski, Marc Erich Latoschik, Carolin Wienrich

16:45 CHORUS: Designing Human–AI Multi-Agent Collaboration for Professional Translators
George Xi Wang, Jiaqian Hu, Guande Wu, Jing Qian

17:00 Framing the Formless: A Xing–Qi–Shen Framework for Culturally Aware Multimodal Human–AI Co-Creation
Conggang Yu, Shudan Tan, Yuxing Zhang, Lin Yu

17:15 Memory-Driven Self-Disclosure and Relational Turning Points: A Longitudinal Multimodal Study of Human-AI Interaction
Ryuichi Sumida, Mao Saeki, Masaki Eguchi, Sadahiro Yoshikawa, Koji Inoue, Tatsuya Kawahara, Yoichi Matsuyama

17:30 Context-Aware Multimodal AI System for Wildfire Decision Support
Shaurya Mathur, Shreyas Bellary Manjunath, Nitin Kulkarni, Alina Vereshchaka

17:45 A Methodology to Compare Real and LLM-Simulated Multimodal Interactions: The Case of Gender Bias
Elodie Etienne, Magalie Ochs, Jean-Michel Loubes, Chloé Clavel