| 1 |
The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production
Guilhem Fauré, Mostafa Sadeghi, ... (+2 more)
|
|
cs.AI
|
0 |
2 months ago |
| 2 |
Reference-Free Assessment of Physical Consistency in World Model-based Video Generation
Yun Oh, Sukmin Yun
|
|
cs.AI
|
0 |
2 months ago |
| 3 |
Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization
Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao
|
|
cs.CV
|
0 |
2 months ago |
| 4 |
Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification
Zhiyuan Tao, Srikumar Sastry, ... (+10 more)
|
|
cs.CV
|
0 |
2 months ago |
| 5 |
Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats
Xiaoyang Liu, Shangzhe Wu, Kai Han
|
|
cs.GR
|
0 |
2 months ago |
| 6 |
Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization
Zhipeng Xu, De Cheng, ... (+4 more)
|
|
cs.CV
|
0 |
2 months ago |
| 7 |
BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation
Rithvik Jonna, Aakash Gurram, ... (+3 more)
|
|
cs.RO
|
0 |
2 months ago |
| 8 |
Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution
Mingyu Choi, Woo Kyoung Han, ... (+2 more)
|
|
cs.CV
|
0 |
2 months ago |
| 9 |
SIR: Structured Image Representations for Explainable Robot Learning
Paul Mattes, Jan Schwab, ... (+6 more)
|
|
cs.RO
|
0 |
2 months ago |
| 10 |
Enhancing Part-Level Point Grounding for Any Open-Source MLLMs
Jin-Cheng Jhang, Fu-En Wang, ... (+5 more)
|
|
cs.CV
|
0 |
2 months ago |
| 11 |
TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation
Zhi Tu, Liangkun Niu, Tianyi Zhang
|
|
cs.CV
|
0 |
2 months ago |
| 12 |
IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion
Lizhou Lin, Songpengcheng Xia, ... (+4 more)
|
|
cs.CV
|
0 |
2 months ago |
| 13 |
Perceptual 3D Simulation With Physical World Modeling
Wanhee Lee, Klemen Kotar, ... (+3 more)
|
|
cs.CV
|
0 |
2 months ago |
| 14 |
Dataset Usage Inference without Shadow Models or Held-out Data
Wojciech Łapacz, Stanisław Pawlak, ... (+3 more)
|
|
cs.LG
|
0 |
2 months ago |
| 15 |
GRAFT: Graph-Based Affordance Transfer via Part Correspondence
Mengying Lin, Utkarsh Mishra, ... (+2 more)
|
|
cs.RO
|
0 |
2 months ago |
| 16 |
Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent
Wenliang Zhong, Rob Barton, ... (+8 more)
|
|
cs.CV
|
0 |
2 months ago |
| 17 |
Mirror Illusion Art
Xiaopei Zhu, Zeyuan Li, ... (+2 more)
|
|
cs.CV
|
0 |
2 months ago |
| 18 |
How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation
Jia Li, Wenjie Zhao, ... (+6 more)
|
|
cs.CV
|
0 |
2 months ago |
| 19 |
Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos
Jinwen Wang, Youfang Lin, ... (+3 more)
|
|
cs.LG
|
0 |
2 months ago |
| 20 |
Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints
Jungkon Kim, Cheolseung Jung, ... (+2 more)
|
|
cs.CV
|
0 |
2 months ago |
| 21 |
Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory
Yu Qi, Hongyu Li, ... (+7 more)
|
|
cs.CV
|
0 |
2 months ago |
| 22 |
GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
Suhaas Garre, Emily Ritchie, ... (+2 more)
|
|
cs.CV
|
0 |
2 months ago |
| 23 |
SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception
Mingjie Xie, Guangjun He, ... (+6 more)
|
|
cs.CV
|
0 |
2 months ago |
| 24 |
GIRAF: Towards Generalizable Human Interactions with Articulated Objects
Xiaohan Zhang, Sebastian Starke, ... (+4 more)
|
|
cs.CV
|
0 |
2 months ago |
| 25 |
Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay
|
|
cs.LG
|
0 |
2 months ago |
| 26 |
Why Fake ? Unveiling the Semantic Vocabulary of Deepfake Detectors
Vazgken Vanian, Alexandros Doumanoglou, Dimitris Zarpalas
|
|
cs.CV
|
0 |
2 months ago |
| 27 |
Andha-Dhun: A First Look at Audio Descriptions in Hindi
Ritabrata Chakraborty, Divy Kala, ... (+4 more)
|
|
cs.CV
|
0 |
2 months ago |
| 28 |
Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning
Suraj Yadav, Anjaneya Sharma, Siddharth Yadav
|
|
cs.CV
|
0 |
2 months ago |
| 29 |
CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling
Tingjia Zhang, Bo Chen, ... (+3 more)
|
|
cs.CV
|
0 |
1 month ago |
| 30 |
Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation
Zesen Zhao, Minkyoung Cho, ... (+5 more)
|
|
cs.RO
|
0 |
1 month ago |
| 31 |
Illuminating Visual Identity in Universal Multimodal Embeddings
Jiawei Cao, Junyi Feng, ... (+6 more)
|
|
cs.CV
|
0 |
1 month ago |
| 32 |
The 1st AI Children Challenge
Boyi Li, Yifan Shen, ... (+8 more)
|
|
cs.CV
|
0 |
1 month ago |
| 33 |
Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA
Site Li, Jianyi Hao, Xiaofeng Liu
|
|
cs.CV
|
0 |
1 month ago |
| 34 |
Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning
Site Li, Jianyi Hao, Xiaofeng Liu
|
|
cs.CV
|
0 |
1 month ago |
| 35 |
Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline
Dipit Saha, Shah Mohammad Abdul Mannan, ... (+3 more)
|
|
cs.CV
|
0 |
1 month ago |
| 36 |
Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation
Bruno Palau, Franziska Vogt, ... (+5 more)
|
|
cs.CV
|
0 |
1 month ago |
| 37 |
HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation
Junhao Hou, Chenqi Luo, ... (+6 more)
|
|
cs.CV
|
0 |
29 days ago |
| 38 |
Beyond Single Object: Learning 3D Relations with Large Language Models
Kohsuke Ide, Ryousuke Yamada, ... (+5 more)
|
|
cs.CV
|
0 |
1 month ago |
| 39 |
Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding
Jeongwan Shin, Jaehyeon Kim, ... (+2 more)
|
|
cs.AI
|
0 |
1 month ago |
| 40 |
Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use
Yi Ding, Yanzhao Yu, ... (+6 more)
|
|
cs.RO
|
0 |
1 month ago |
| 41 |
Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation
Junming Zhang, Shuyu Yin, ... (+3 more)
|
|
cs.CV
|
0 |
1 month ago |
| 42 |
Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection
Jimin Roh, DongKyu Kim, Suk-Ju Kang
|
|
cs.CV
|
0 |
1 month ago |
| 43 |
Gaze Target Estimation Anywhere with Concepts
Xu Cao, Houze Yang, ... (+6 more)
|
|
cs.CV
|
0 |
1 month ago |
| 44 |
GuidedFlow: An Attention-Guided Framework for Anomaly Detection in Additive Manufacturing
Sosmita Paul, Krishna Roy
|
|
cs.CV
|
0 |
22 days ago |
| 45 |
ORBIT++: Benchmarking SfM in the Wild with 360° Video
Sara Sabour, Linyi Jin, ... (+10 more)
|
|
cs.CV
|
0 |
24 days ago |
| 46 |
Fine-Grained Multi Image Object Hallucination Benchmark
Joonki Min, Chaeyun Kim, ... (+5 more)
|
|
cs.CV
|
0 |
15 days ago |
| 47 |
SynCrash: A Multi-Stage Pipeline for Zero-Shot Accident Detection and Localization in Traffic Surveillance Video
Arkya Jyoti Bagchi, Ritul Jangir, Varun Raskar
|
|
cs.CV
|
0 |
16 days ago |
| 48 |
Dynamic Important Example Mining for Reinforcement Finetuning
Haoru Tan, Sitong Wu, ... (+10 more)
|
|
cs.AI
|
0 |
17 days ago |
| 49 |
A Tensor Variational Formulation of Gradient Energy Total Variation
Freddie Åström, George Baravdish, Michael Felsberg
|
|
cs.CV
|
0 |
17 days ago |
| 50 |
MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA
Haowen Gu, Gensheng Pei, ... (+5 more)
|
|
cs.CV
|
0 |
19 days ago |