Sessions
Main Conference Day 1 – Tuesday, 6 October 2026
10:00-11:00 Poster Session #1: Affective Computing, Health & Wellbeing
Affect-Aware Game Personalization with Reinforcement Learning: How to Improve Players’ Engagement, Performance, and Emotions
Mahyar Tourchi Moghaddam, Tiziano Santilli, Mina Alipour
A Screening Method for Children with Autism Spectrum Disorder Based on a Dual-Stream, Multi-Scale, Cross-Modal Attention Mechanism
Haoran Sun, Bang Li, Xiaoqing Jiang, Liu Chen, Shengduo Hu, Chenyang Liang, Jianwei Gu, Kaiyun Li, Zhenxiang Chen
Multimodal Biomarkers of Dysarthria: Severity-Conditioned Contrastive Alignment of Speech, Text, and Facial Asymmetry
Karen Rosero, Chi-Chun Lee, Rami R. Hallac, Carlos Busso
Self-Supervised Dual-Stream Temporal Learning for Neonatal Pain Estimation
Muhammad Suhaib Shahid, Michel Valstar, Don Sharkey, Joy Egede
From Feedback to Neural Dynamics: Network-Based Modeling of EEG in Interactive Tasks
Behdokht Kiafar, Mohammad Fahim Abrar, Roghayeh Leila Barmaki
Multi-Scale Spatiotemporal EEG and Self-Supervised Audio Fusion: A Mixture-of-Experts Approach to Continuous Affect
Ali Amini, Sarmad Maqsood, Irfan Abbas, Muhammad Abdullah Sarwar, Rytis Maskeliūnas, Robertas Damaševičius
From Facial Expressions to Emotional Health: Deploying Affective Computing in Call Centers
Lesly Nzeusseu Kouamou, Pierrich Plusquellec
Correcting in the Moment: Evaluating Real-Time AI Postural Feedback for Cellists
Paolo Wang, Kexin Sha, Kunzhu Xie, Michael Zhang, Shrinand Perumal, Ekaterina Tszyao, Jackson Shields, Luke Choi, Sivamurugan Velmurugan, Preston Mo, Daniel Chindris, Wangyue Xue, Mohammad Rahman, Ming Yin, Zhenyu Cheryl Qian, Yingjie Victor Chen, Ka-wai Yu, Yung-Hsiang Lu, Kristen Yeon-Ji Yun
FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment
Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes
Breathing Signal Prediction from Speech: Toward Reproducible and Comparable Models
Francisca Pessanha, Glenn de Wildt, Alexis Deighton MacIntyre, Heysem Kaya, Almila Akdag
Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating
Yuriko Kikuchi, Takato Hayashi, Ryusei Kimura, Naoya Inoue, Ryo Ishii, Shogo Okada
From Signals to Connection: Exploring Physiological Markers of Human–Nature Connectedness
Olivia Brunet, Romain Grandchamp, Benoît Fernandez, Gladys Barragan-Jason, Axel Carlier
Light-ED: Lightweight Multimodal Emotion Detection using Enhanced EfficientNet
Wamika Jha, Mea Wang, Usman Alim, Zoe Kirsman
Unmasking Suppressed Emotion: A Multi-Agent Approach to Affective Dissonance
Chenghong Lin, Tochukwu Eze, Dawei Xie, Khalil J Anderson, Bookyung Shin, Marcelo Worsley
Multimodal Behavioral Typicality as a Training-Free Screening Signal for Dementia
Leticia Pinto-Alva, Gale Lucas, Maja J Matarić, Jesse Thomason
Who, Where, How Matters: Evaluating Emotion Recognition under Context Shifts
Sayak Mukherjee, Tom Viering, Bernd Dudzik
A Unified Tokenization Framework for Pain Recognition using Heterogeneous 3D Modalities
Stefanos Gkikas, Christian Arzate Cruz, Valentina Becchetti, Muhammad Umar Khan, Alessandro Giuseppi, Raul Fernandez Rojas
Autism Screening via Pose Kinematics and Shallow Graph Embedding for Small-Sample Dyadic Imitative Interaction
Bang Li, Zhenxiang Chen, Haoran Sun, Xiaoqing Jiang, Jianwei Gu, Chenyang Liang, Shengduo Hu, Kaiyun Li
11:00-12:30 Oral Session #1: Conversational AI, Speech & Avatars
11:00 HAAS: Holistic Attention-free Animation from Speech using Mamba
Laxmi Narayen Nagarajan Venkatesan, Harsh Vardhan Singh, Vansh Sinha, Sai Madhavan G, Subhajeet Lahiri, Rahulraj B R, Vaishnavi Josyula, Dinesh Babu Jayagopi, Raj Tumuluri, Magnus Revang, Ajai Devanathan
11:15 TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations With Young Adults
Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor
11:30 Unleashing Chain-of-Thought Style Reasoning for Text-to-Speech Systems
Ziyue Jiang, Zhou Zhao
11:45 Conversational Facial Dynamics as Behavioral Identity Signals: From Naturalistic Conversations to Avatar-Mediated Communication
Masoumeh Chapariniya, Pierre Vuillecard, Jean-Marc Odobez, Volker Dellwo, Teodora Vukovic
12:00 AFA: Identity-Aware Memory for Preventing Persona Confusion in Multi-User Dialogue
Mohammad Al-Ratrout, Pavan Uttej Ravva, Shayla Sharmin, Aditya Raikwar, Ju Young Shin, Roghayeh Leila Barmaki
12:15 Towards a Voice Design Tool to Support Game Masters of Tabletop Role-Playing Games
Laura Kanschat, Johanna Kuch, Daksitha Senel Withanage Don, Niklas Heimerl, Silvan Mertes, Elisabeth André
14:00-15:00 Special Session: Multimodal Sensing and Interventions for Mental Well-being
14:00 Multimodal Anxiety Detection with Adaptive Hyperbolic Few-Shot Learning
Aditya Sneh, Nilesh Kumar Sahu, Anushka Sanjay Shelke, Arya Adyasha, Haroon R. Lone
14:15 Modeling Affective Distress from Video: A Modality-Aware Multi-Branch Learning Approach
Om Govind Jha, Nilesh Kumar Sahu, Haroon R. Lone
14:30 Multimodal features for multi-perspective assessment of working alliance in therapist-patient psychotherapy
Rivka Vollebregt, Lennard René Bornemann, Sanne J.E. Bruijniks, Albert Ali Salah
14:45 “Why does the computer say I am depressed?” Towards a better understanding of concepts in automatic depression detection
Sytse Backx, Stan Meyberg, Gizem Sogancioglu, Heysem Kaya
15:00-16:30 Poster Session #2: Social Interaction, Dialogue & Human–AI Interaction
Takes Two to Know One: An Approach for Personality Prediction from Dyadic Conversation Based on Text
Zijie (Jack) Zhou, Siyuan Chen
Real-time Multimodal Addressee Detection in Multi-party Dialogue
Divesh Lala, Koji Inoue, Taiga Mori, Tatsuya Kawahara
I Don’t Always Do What I Am Told: The Case for Task Incongruence-Aware Systems for Technology-Supported Reflection on Social Interactions
Chenxu Hao, Tiffany Matej Hrkalovic, Bernd Dudzik, Hayley Hung
The Role of Language Understanding in Speech-Based Multimodal Automatic Personality Perception
Nisreen Alshubaily, Emily O’Hara, Tanaya Guha, Alessandro Vinciarelli
Binaural Speech and Distribution Learning for Predicting Auditory Distance Perception in Audio Augmented Reality
Sahar Altalhi, Tanaya Guha, Alessandro Vinciarelli
Multimodal Rapport Estimation in Real-World HRI
Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada
Automated Behavioural Analysis in Parent-Infant Interactions using Multimodal-Large-Language Models
Daksitha Senel Withanage Don, Tobias Hallmen, Mitho Müller, Lea Kaubisch, Linda Stürmlinger, Yaren Günay, Anna-Lena Zietlow, Beate Ditzen, Johannes C. Ehrenthal, Cristina Luna-Jiménez, Prof. Dr. Corinna Reck, Elisabeth André
HARMONI: Multimodal Personalization of Multi-User Human-Robot Interactions with LLMs
Jeanne Malecot, Hamed Rahimi, Jeanne Cattoni, Marie Samson, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani
Multimodal Behavioural Indicators of Social Performance in Collaborative Problem Solving
Jennifer Hamet Bagnou, Amine Benamara, Céline Clavel, Jean-Claude Martin, Elise Prigent
“Great! The Next Step Is…”: In Pursuit of Proactive Assistance with Multimodal Foundation Models
Sean Andrist, Dan Bohus, Maia Stiber, Yuwei Bao, Tim Schoonbeek, Eric Horvitz
Beyond Rhythm and Prosody: Inter-Utterance Silence Predicts Drone Movement Duration in Spontaneous Vocal Guidance
Allan Henry, Solange Rossato, Christian Graff, Sylvain Huet, Jose-Ernesto Gomez-Balderas
From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios
Thai Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel
Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue
Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell
Impact of Adaptive Feedback in Multimodal Human-Agent Interaction
Shaid Hasan, Sujan Sarker, Tariq Iqbal
Big5-HCD: A Human-Computer Dialogue Benchmark with Personality Annotations via Semi-Supervised Adaptation
Weidong Zhang, Haifeng Guo, Weiming Wang, Haoran Xie, Fu Lee Wang
Clustering Co-Speech Gestures Using Morphological Representations
Simbarashe Nyatsanga, Huanjie Dong, Ikhsanul Habibie, Christian Theobalt, Michael Neff
Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach
Ha Anh Ngo, Nicolas Rollet, Catherine Pelachaud, Chloe Clavel
Joint Attention Modeling in Naturalistic Interactions with Social Gaze and Proximity Cues
Miranda Dickerman, Michael Villamizar, Sabine Stoll, Jean-Marc Odobez
Facial Expressions and Gaze Behavior Patterns During a Collaborative Board Game
Amine Benamara, Céline Clavel, Brian Ravenet, Nicolas Sabouret, Julien Saunier
Speaker Diarization in Static and Egocentric Videos via Speech-Face Alignment
Zeyang Zhang, Xavier Yin, Zhaobo Zheng, Kumar Akash, Teruhisa Misu, Carlos Busso
Deception Detection Across Diverse Interaction Contexts: A Progressive Transfer Learning Approach
Abdullah Alzahrani, Eve Gittins, Muneeb Ahmad
Validation of a Multi-level Self-Report Rapport Scale and its Impact on Multimodal Modeling of Small Group Interaction
Justine Reverdy, Oussama Silem, Justine Cassell
Real-time Generation of Listener Nodding via Prediction of Kinematic Parameters for Avatar Dialogue Systems
Kazushi Kato, Koji Inoue, Taiga Mori, Divesh Lala, Tatsuya Kawahara
Defining “Neutral” Agents: A Critical Review and Future Guidelines
Emma Jane Pretty, Weichen Li, Anna-Leena Macey, Nannan Xi, Juho Hamari
Code-to-Speech: An Exploratory Study of AI Text-to-Speech for Source Code Readability
Marco Cardia, Letizia Angileri, Marina Buzzi, Barbara Leporini
CoRead: Using Implicit Behavioural Signals for Mixed-Initiative AI Support in Collaborative Academic Reading
Sakil Sarker, Yasaman A.Basti, Heidar Davoudi, Ali Neshati
NVFCorpus: A Corpus for Analyzing Multimodal and Multifunctional Nonverbal Behavior in Multiparty Conversations
Kazuhiro Otsuka, Takumi Nishihira, Yuya Nishimura, Issa Tamura
16:30-18:00 Oral Session #2: Emotion, Affect & Well-being
16:30 Smiling Regulates Emotion During Traumatic Recollection
Marcus Ma, Emily Zhou, Leonard Ludwig, Julia Hörath, Christina Winkler, Kleanthis Avramidis, Tiantian Feng, Gabor Mihaly Toth, Alina Bothe, Shrikanth Narayanan
16:45 Hierarchical Quantized Cross-modal Masked Autoencoders for Audio-Visual Emotion Recognition
Zeyang Zhang, Carlos Busso
17:00 MindBeat: A Multimodal Interface for Stress Recovery through Rhythmic Fidgeting
Wenjie Xu, Ziang Xu, Rui Zhang, Qinjie Wang, Fangtian Ying
17:15 Beyond Surveys: Predicting Student Well-being from Open-ended Video Responses using LLMs
Thu Bui, Minjun Choi, Shifa Somji, Hillary Merzdorf, Nan Kong, Louis Tay, Sooyeon Jeong
17:30 Interoception-Inspired Emotion Estimation via Intrinsic Diffuseness-Guided Learning
Haifeng Zhang, Von Ralph Dane Marquez Herbuela, Yukie Nagai
17:45 EmotiStage: Designing an Emotion-Driven Performance System with Multi-modal Generative AI to Support Emotional Awareness
Ziying Wang, Yihong Lin, Xianglin Zhao, Yirui Huang, Ziya Zhou, Wei Xue, Wanling Cai, Yucheng Jin
18:00-18:30 Challenge Overview
Main Conference Day 2 – Wednesday, 7 October 2026
10:00-11:00 Demo, DC
Demonstrations
AUGI: Multimodal Gestural and Tactile Control for Acoustic Wind and Brass Instruments
Susan E Green-Mateu, Jackson Tallamy, Kyle Hutchins
BuddyBack: A Multimodal Smart Posture Correction System
Federico Raponi, Marco Realacci, Lorenzo Spataro, Danilo Avola, Maurizio Mancini, Emanuele Panizzi
ConceptLens: Interactive Concept Bottlenecks for Black-Box Models
Hasan Md Tusfiqur Alam, Abdulrahman Mohamed Selim, László Kopácsi, Daniel Sonntag
Embodying Luca Giordano: A RAG-Grounded Context-Aware Robot for Cultural Heritage Storytelling
Mario Barbato, Marco Grazioso, Martina Di Bratto, Azzurra Mancini, Valentina Russo, Silvia Rossi
Emotional Echoes: A Spatialized VR Gallery for Revisiting and Reinterpreting Emotional Memory
Yao Liu, Marina Carulli, Monica Bordegoni
FLIDIS: An Experimental Infrastructure for Dual-Task Research in Continuous Control and Multimodal Interaction
Charles O Njoku, James Blundell
MULTIDATA: An Interactive Web Platform for Speech-Gesture Data Extraction and Visualization
Raúl Sánchez, Daniel Alcaraz Carrión, Irene Bolumar Martínez, Armine Garibyan, Yassine Iabdounane, Mark Turner, Peter Uhrig, Cristóbal Pagán Cánovas
Vibrotactile Feedback for Accessible Audio Production: Demonstrating HAPCI and HFAM
James Hurley, Jon Drummond, Bert Bongers
Windborne: Fostering Nature Connection and Playfulness through Multimodal Interaction in Healthcare Settings
Borui Wang, Keith Evan Green
Doctoral Consortium Posters
Multimodal Modeling of Microsurgery Training Assessment
Ayobami Oyewole
Towards Memory-Aware Adaptive Agents
Deborah van Sinttruije
Buzz, Bid, Body: Multimodal Practices of Distributed Recognition
Pipob Puthipiroj
Generic modeling of Human-Machine Interaction
lykong un
Multimodal detection and classification of humor in human-human and human-machine interactions
Sofia Callejas
Structured Representations For Human-Robot Interaction with Non-Expert Users
Valerie K. Chen
What Matters Over Time: Temporal Properties of Non-Verbal Signals for Intent Recognition in Human–Robot Interaction
Eunyoung Hwang, Alessandra Rossi, Silvia Rossi
Designing Multimodal Conversational AI for Longitudinal Well-Being Monitoring
Thu Bui
Socially Interactive Agent for Group Debate Mediation
Nahuel Gómez
FAU-Preserving Video Anonymization for Privacy-Aware Reproducible Research
Sophin Chheng
Multimodal Subjective Intention Modeling in Social Interactions
Arthur Mercier
11:00-12:30 Oral Session #3: Neurophysiological & Wearable Multimodal Sensing
11:00 Multimodal Learner-State Analytics: Cross-Modal Insights from Motor-expressions and EEG for Instructor-Facing Visualization Platform
Qi Song, Gaoyuan Zhang, Chengchen Lyu, Xurong Xie, Naiming Yao, Hui Chen, Feng Tian
11:15 μDPad: A Large-Scale Multimodal PPG and IMU Dataset for Wrist-Worn Microgesture Recognition
Lars Hauptmann, Dominik Hollidt, Xintong Liu, Manuel Meier, Christian Holz
11:30 MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis
Yuanhao Chen, Peter Chin
11:45 SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval
Akshaj Murhekar, Christina Liu, Abhijit Mishra, Shounak Roychowdhury, Jacek Gwizdka
12:00 Investigating Foundation Models, Disentanglement and Latent Alignment for Subject-Independent EEG Learning
Lia Schmid, Jacopo Burger, Alessandro D’Amelio, Raffaella Lanzarotti
12:15 MIMIC: A Real-Time Multimodal Framework to Provide Fine-Grained Motion Corrections Remotely
Blain Judkins, Jennifer Yentes, Edgar Javier Rojas-Muñoz
14:00-15:00 Blue Sky Papers
14:00 Human Hardware in an Agentic World: Jia’s Journey as a Biological Actuator and the Call for Sovereign Interaction Design
Lik-Hang Lee
14:20 The Person Multimodal AI Cannot Finish
Mohammad Rashedul Hasan
14:40 The Recognition-Consequence Gap: How Gesture Recognition Misses Human Action
Stephanie A Scopelitis, Dane DeSutter
15:00-16:30 Poster Session #3: Multimodal Learning, Vision-Language Models & Responsible AI
GRoFA: Noise-Gated Adapters for Jointly Fair and Robust Face Embeddings
Amu Suemoto, Yutaka Arakawa, Tsunenori Mine
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal Assembly Assistants
Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei
How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata
Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki
Bridging the Spatial Blind Spot in Pathology Foundation Models for Tumor Localization
Guoshuai Xu, Kai Zhang
STACK: 3D Spatial Task Analysis in Collaborative Construction Keyframes
Changsoo Jung, Sheikh Abdul Mannan, Jack Fitzgerald, Ethan Seefried, Videep Venkatesha, Sifatul Anindho, Nathaniel Blanchard
NewsSegCap: Efficient Dense Video Captioning for TV News
Antoine Brimont, Titus Zaharia, Ruxandra Tapu
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
Yuliang Cai, Jesse Thomason, Mohammad Rostami
When Cross-Modal Attention Fails under Channel Degradation: Diagnosing Dominant Interaction Structure for Reliable Multimodal Interaction
Bin Liu, Zhaoxiang Xiao, Zhengpeng Liu
Distilling the Noise: Value-Aware Contrastive Hypergraph Learning for Robust Multimodal Rumor Detection
Heng Zhang, Weiyu Zhang, Chaoqun Zheng, Rui Wang, Jiasheng Si, Wenpeng Lu, Deyu Zhou
Self-Distillation as a Structure-Dependent Mechanism in Multimodal Dialogue via Multi-Context Modeling
Ryo Ishii, Chihiro Takayama, Jiro Nagao, Toshiki Onishi, Yukiko Nakano, Junichi Sawase
Human-Centered Metrics for Evaluating Usability in Artificial Intelligence Generated Human Object Interactions
Shengdi Xiao, Yuto Asano, Jingjing Li, Yoichi Ochiai
Towards Gaze-Informed AI Disclosure Interfaces: Eye-Tracking Attentional and Cognitive Load While Reading AI-Assisted News
Pooja Prajod, Hannes Cools, Thomas Röggla, Pablo Cesar, Abdallah El Ali
SIGMA: Statistical Memory Head for Robust Class-Incremental Vision–Language Learning with CLIP
Dinh-Dat Nguyen, Duc-Duy Mai, Hung Xuan Ho Mr, Quynh-Trang Pham Thi, Thanh-Hai Dang
M3CA: Multi-modal and Multi-view Fusion based on Multi-layer Cross Attention for Isolated Sign Language Recognition
Jinyang Feng, Zhong Guan, Yongli Hu, Jiahai Yang
An Explainable Neurosymbolic Multimodal Deepfake Detection with A Comparative Study of Cross-Dataset Generalization
Md Shafiqul Baten Sumon, Fatma Najar
From Bytes to Semantics: LLM-Agent-Driven Commit Message Generation for Non-Code Assets
Liran Wang, Zhoujun Li
HuGDAT: Guiding Transformer Attention with Human Vision
Ahmad Waseem, Pietro Ruiu, Andrea Lagorio, Seth Nixon, Massimo Tistarelli
Local Optical Flow for Eye Movement Event Detection in Head-Mounted Setups
Abdulrahman Mohamed Selim, Omair Shahzad Bhatti, Lukas Wilde, Khue Minh Pham, Michael Barz, Daniel Sonntag
Towards Responsible AI in Low-Resource Languages: Evaluating LLM Responses with a Culturally Aware Sinhala Dataset
Liyanaarachchige Dona Rashmi Nirasha Gunawardana, Ayantha Randika, Dushani Perera, Kasun Karunanayaka
ADMC: Attention-based Diffusion model for Missing modalities Completion
Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, En Zhu, Liangze Yin
TraceNote: Instructor Cursor Dynamics as Spatiotemporal Signals for Importance-Aware Lecture Note Generation
Yao Tong, Su Wang
ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Slide Refinement
Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao
EST-inspired computational approaches to event boundary detection
Amirarsalan Serajoddin Mirghaed, Gualtiero Volpe, Giovanna Varni
Pre-processing Techniques for Multimodal Affective Computing: Implications for Data Quality and Multimodal Fusion
Célio Carvalho, José Torres, Rui Silva Moreira
GroundingGaze: An Interactive Pipeline for Automatic Gaze Annotation
Mounika Kanakanti, Ferdinand Otmar Paar F.P., Asli Ozyurek, Chinmaya Mishra
16:30-18:00 Oral Session #4: Engagement, Behavior & Human State Modeling
16:30 Interpretable Multimodal Engagement Prediction with Graph-based Mixture-of-Experts
Monisha Singh, Abhinav Dhall
16:45 From Detection to Mechanism Analysis: Interpretable Multimodal Concept Interactions in Gesture Pragmatics
Jinqian Zhang, Sixia Li, Candy Olivia Mawalim, Shogo Okada
17:00 Self-Supervised Representation Learning for Heterogeneous Behavioral Expressions of Social Engagement
Naga Venkata Sai Raviteja Chappa, Lisa Yankowitz, Gokul M Nair, Evangelos Sariyanidi, Casey J. Zampella, Kathleen Campbell, Whitney Guthrie, John D. Herrington, Robert T. Schultz, Birkan Tunc
17:15 Human-as-a-Sensor: Inferring Individual Engagement from Teammates Alone via Latent Group State Modeling
Zhaobo Zheng, Navid Salami Pargoo, Kumar Akash, Teruhisa Misu
17:30 How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks
Tahiya Chowdhury
17:45 SQUAD: A Unified Framework for 3D Dyadic Scene Understanding with Applications to Visual Focus of Attention and Object Use
Berfu Karaca, Niilo V. Valtakari, Albert Ali Salah, Jaap J. A. Denissen, Sonja M. C. de Zwarte, Ronald Poppe
Main Conference Day 3 – Thursday, 8 October 2026
10:00-11:00 Poster Session #4: XR, Embodied Interaction & Multimodal Interfaces
Quantifying 3D Pointing: Characterizing What Happens During Pointing Selection in Virtual Reality
Junhan Kong, Jacqui Fashimpaur, Michael J Proulx, Hemant Bhaskar Surale, Jacob O. Wobbrock, Amy Karlson
Did I Just Cheer in a Concert Hall?: Enhancing Remote Participation with Congruent Self-Voice Feedback
Hikari Kato, Tomoaki Konno, Toshiharu Horiuchi
XRPoseSync: A Synchronized Multimodal Dataset for EdgeXR Pose Prediction
Ziyu Zhong, Jens Nirme, Hector A Caltenco, Stefan Lindgren, Björn Landfeldt
TriSelect: Distance Adaptive Multimodal Object Selection in Virtual Reality Using Eye Gaze, Hand Gesture, and Voice
Jai Sachdeva, Prashant Rawat
Partner Representation Shapes Coordination Tradeoffs in Shared XR
Ehtisham Ul Haq, Robert S. Allison, Laurie M Wilcox
Hands-VRee: Towards Hands-Free Gaming in VR via Concurrent Input for Locomotion, Viewport Control, and Pointing
Adrian Javier Leon Valencia, Pedro Tavares, Inês Alves, Ian Oakley, Augusto Esteves
IntentVLM: Open-Vocabulary Intention Recognition through Forward–Inverse Modeling with Video-Language Models
Hamed Rahimi, Clémence Grislain, Adrien Jacquet Crétides, Olivier Sigaud, Mohamed Chetouani
Disrupted Harmony: How Visual–Audio Incongruence Influences Creativity in Collage Making
Leyan Wu, Yalong Luo, Andi Wan, Yucheng Jin
Han-Vibe: Culturally-Situated Multimodal Interaction for AI-Mediated Live Music Performance
Zhengyang Ma
Audiovisual Material Perception in Virtual Reality
Harshitha Koppisetty, Laurie M Wilcox, Robert S. Allison
Multimodal User Simulation with Cross-Modal Grounding for Virtual Museum Interaction
Shreya Sanghamitra, Shihan Wang, Shenghui Wang
What you know, How you act: Transactional VR Authentication
Numan Zafar, Shafique A Chaudhry
Pose-to-Command: A Personalized Embodied Control Layer for Ordinary Games
Tung Khau, Matthias Rueger, Gerrit Meixner
Exploring Thermal Color Cues to Evoke Thermal Illusions in Virtual Object and Hand-to-Hand Interactions in VR
Artem Sultanov, Alexander Raake, Stephanie Arevalo Arboleda
Inferring Openness to Experience from Behavioral Signals in a Virtual Reality Art Gallery
Aaditya Vardhan Narain, Raman Saxena, Y. Raghu Reddy
Causal Temporal Padding for Low-Latency Real-Time Gesture Generation
Ryo Ishii, Shinichiro Eitoku, Jiro Nagao, Junichi Sawase
Auditory Feedback as a Communication Modality: Modeling Perceived Semantic Expression of UX Sounds
Annika Frommholz, Steffen Lepa, Stefan Weinzierl, Johannes Helberger
AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models
Eu Jin Lim, Zhaoxing Li, Sebastian Stein
11:00-12:30 Oral Session #5: Multimodal Reasoning, Explainability & Methods
11:00 DatasetOS: An Agentic Framework For Multimodal Dataset Construction
Bashayer Alsreidi, Ghaleb Aldoboni, Lobna Nassar, Fakhreddine Karray
11:15 Explanation Needs Emerge Before Explicit Requests in Human-Robot Interaction
Dimosthenis Kontogiorgos, Joakim Gustafson, Julie Shah
11:30 S-AODP++: Structure-Aware AOI-Guided Scanpath Attention for AI-Generated Image Identification
Jingming Wang, Renwei Meng, Yunjie Si
11:45 SPICE: Synergy and Partial Information Based Curriculum Evolution
Ankush Pratap Singh, Houwei Cao, Yong Liu
12:00 Scene-Conditioned Capability Mounting as a Visible and Executable Boundary for Situated LLM Agents
Siyu Jiang, Yuxuan Cheng, Jiayi Wang, Sanshuai Cui
12:15 MapQA: A Map-Question-Answering Benchmark for Visual Language Model Reasoning
Christian Arnold, Andrew Alini, Abdulrahman Alabdulkareem, Jonathan Wang, Pieter Feenstra, Conner Arnold, Jan Kenneth DeWitt, Natalie Christina Ritsema, Jung Hyun Yae, Boris Katz, Andrei Barbu, Brian Cheung
15:00-16:30 LBR
How Local AI Framing Shapes User Experience and Perceived Data Security with an Embodied AI Psychotherapist in VR
Paula Friedrich, Lukas Polifke, David Obremski, Marc Erich Latoschik, Carolin Wienrich
A Clinical Decision Support System Prototype for Multimodal Youth Mental Health Monitoring
Carlo Mazzola, Helen Stocks, Ula Kolinska, Izidor Mlakar, Gwendolyn Mayer, Zouhair Haddi
Designing a Functional Social Robot for Blood Test Procedures in the Emergency Department: A Human-Centered Approach
Yuval Rubin Kopelman, Dikla Dahan Shriki, Zohar Fein, Mahmod Hamdan, Rony Ben Ami, Daniel Armoni, Andrey Grishko, Nevo Heimann Saadon, Hadas Erel
“Nobody Told me Farming is not Only Farming”: A Conversational AI Agent for Causal Loop Reasoning with Japan Farmers
Tomohide Mizuuchi, Eduardo Feteira, Liuru Nan, Mami Yoda, Wan-Jou She, Panote Siriaraya
Structured Patterns of Dyadic Motion Coordination Predict Communicative Success
Aditya Mutharasu, Elayna Bowe, James Benjamin Falandays
Benchmarking Prompt Extension and Image Generation Models for Automotive Instructional Imagery
Yuval Zak, Eli Tzirkel
CEMAS – a Configurable Embodied Multi-Agent System
David Obremski, Lukas Polifke, Marc Erich Latoschik, Carolin Wienrich
Emerging Agency-Aware Interface Patterns in AI-in-the-Loop Platforms
Massimo Bertolotti, Silvia Di Giulio, Genoveffa Tortora, Luigi Troiano
How Humans Evaluate Headline-Map Climate Change Misinformation with Multi-Agent (In)consistent Guidance?
Nianhua Liu
Aligning Gaze, Space, and Cognition: A Multimodal Triangulation Framework for Visitor Interactions in Cultural Heritage (An Expert vs. Non-Expert Comparative Study)
Zihe Wei, Yufei Liu, Dan Zhang, Xin Zhang, Miao Sun
How to Greet Humans: Designing Opening Encounters for Functional Robots with Naive Users
Tom Hitron, Nevo Heimann Saadon, Guy Doron, Thomas H. Weisswange, Hadas Erel
Implied Expressive Motions in Paintings: An Early Study on the Limits of Text-to-Motion Generation
Mohammadreza Mahmoudi, Nicola Corbellini, Cora Gasparotti, Nicola Ferrari, Antonio Camurri
Do Emotional Cues Matter? Exploring Support Strategy Selection in LLM-Based Supportive Conversations
Weiyi Tian, Safak Dogan, Jie Meng
Beyond the Vibration Channel: A Signal-Level Benchmark for Dry-Sand Touch on Phones
Takahiro Yamamoto, Toshiharu Igarashi
Continuous wrist kinematics carry lexical cues for temporal deixis
Raúl Sánchez Sánchez, Cristóbal Pagán Cánovas
Does Listening Matter? Backchanneling and Nodding in AI Clone
Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara
An Exploratory Multimodal Analysis of Digital Handwriting and Spontaneous Speech Features to Distinguish Early Cognitive Impairment from Normal Aging
Maria Santina Ler, Maria Sarno, Miriam Veneziano, Gennaro Cordasco, Anna Esposito, Antonio Perna
3D Gaze Ray Dynamics During Palpation-Centered Nursing Assessment of Edema
Masato Fukuda, Mitsuhiro Goto, Koki Ebina, Aya Saitoh, Noriko Yagyuda, Shigekuni Kondo, Sayuri Sakai
Modeling Participant Behavior Across Utterances and Silent Intervals for Engagement Estimation of Individuals with ASD
Hiyori Toda, Jie Zeng, Fumio Nihei, Chihiro Takayama, Ryo Ishii, Masatsugu Tsujii, Yukiko Nakano
A Multimodal Latent State-Space Framework Reveals Spontaneous Interpersonal Synchrony Dynamics
PhD Yubraj Gupta, PhD Stefanie Suttkus, PhD Steffen Schulz, PhD Feliberto de la Cruz, PhD Maria Geisler, Dr Karl-Juergen Baer, PhD Andy Schumann
A Multilingual Speech-Driven Semantic Input Module for University Indoor Wayfinding
Gökhan Ceylan, Gabriella Trasciatti, Emanuele Panizzi
How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
Corey DC Heath
Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot
Yuki Okafuji, Koji Inoue, Yoshiki Ohira
Explainable AI Insights into Gender-Associated Facial and Upper-Body Patterns in Public Speaking: An Exploratory Study
Nesrine Fourati, Kamel Madi
Is Bad Handwriting Really Bad? Multimodal Human–AI Interpretation of Illegible Handwriting in Palliative Care
Zhigang Ni, Lei Yang
DyadicTickTacking: Multimodal Co-Evolution of Joint Strategies and Turn-Taking in Expert-Novice Scaffolding
Ali KhaliliKandjani, Gabriele Romano, Nicola Corbellini, Gualtiero Volpe
When Coordination Signals Can Mislead: Conversational and Facial Markers of Transactive Functioning in Newly-Formed Virtual-Reality Teams
Tristan Lannuzel, Beatrice Biancardi, Mukesh Barange, Stéphanie Buisine
A Modular Open-Source Augmented Reality Drone Environment for Human–Drone Interaction Research
Vilmer Malm, Hugo Raimer, Javier Jiménez Ruescas, Fanta Camara, Mohammad Obaid
A Reproducible Multimodal LLM-as-a-Judge Workflow for Exploring Epistemic Dissonance
Rei Yuda
Can Vision-Language Models Extract Relevant Multimodal Cues for Post-Inference Cue Integration? A Comparison of Affective Judgments on Adult and Child Interaction Data
Xiajie Zhang, Sharifa Alghowinem, Hae Won Park, Cynthia Breazeal
CreaRobot – Improving creativity using a social robot
Salvatore Maria Anzalone
Towards a Multimodal Video-Based Approach for Editable Piano Score Transcription
Silvia Di Giulio, Luigi Troiano, Genoveffa Tortora
SMILE: A Hybrid Memory-Driven Dialogue Manager for Social Companion Robots
Mariacarla Staffa, Salvatore Maria Anzalone, Lorenzo D’Errico
LLMs with a Heart: Using Contextual Heartbeat Haptics to Add Feeling to Text and Audio LLM Interactions
Prithiv Premkumar, Shuyuan Liu, Ryan Clark, Ken Shibata, Christopher Vaughn Casarez, Bruce N. Walker
Evaluating the Impact of Large Language Model Assistance on Human Attention Paradigm in Human–Robot Collaboration
Tajbeed A. Chowdhury, Jose A. Trapero, Farah I. Corona-Strauss, Daniel J. Strauss
From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction
Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska
From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility
Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour
16:30-18:00 Oral Session #6: Human–AI Collaboration, Co-Creation & Simulation
16:30 Ethical Guidelines and Stakeholder Perspectives on the Use of Conversational AI in Psychotherapy – A Scoping Review
Paula Friedrich, David Obremski, Marc Erich Latoschik, Carolin Wienrich
16:45 CHORUS: Designing Human–AI Multi-Agent Collaboration for Professional Translators
George Xi Wang, Jiaqian Hu, Guande Wu, Jing Qian
17:00 Framing the Formless: A Xing–Qi–Shen Framework for Culturally Aware Multimodal Human–AI Co-Creation
Conggang Yu, Shudan Tan, Yuxing Zhang, Lin Yu
17:15 Memory-Driven Self-Disclosure and Relational Turning Points: A Longitudinal Multimodal Study of Human-AI Interaction
Ryuichi Sumida, Mao Saeki, Masaki Eguchi, Sadahiro Yoshikawa, Koji Inoue, Tatsuya Kawahara, Yoichi Matsuyama
17:30 Context-Aware Multimodal AI System for Wildfire Decision Support
Shaurya Mathur, Shreyas Bellary Manjunath, Nitin Kulkarni, Alina Vereshchaka
17:45 A Methodology to Compare Real and LLM-Simulated Multimodal Interactions: The Case of Gender Bias
Elodie Etienne, Magalie Ochs, Jean-Michel Loubes, Chloé Clavel


