| 351 |
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
Zhiyuan Yao, Zheren Fu, ... (+4 more)
|
|
cs.CV
|
0 |
1 month ago |
| 352 |
Learning Video Dynamics with Predictive Differentiable Rendering
Yujin Tang, Tian Zhou, ... (+6 more)
|
|
cs.CV
|
0 |
1 month ago |
| 353 |
OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models
Huanlin Gao, Fang Zhao, ... (+9 more)
|
|
cs.LG
|
0 |
1 month ago |
| 354 |
WarpI2I: Image Warping for Image-to-Image Translation
Shen Zheng, Anurag Ghosh, ... (+2 more)
|
|
cs.CV
|
0 |
1 month ago |
| 355 |
The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning
Brent A. Griffin, Jason J. Corso
|
|
cs.CV
|
0 |
1 month ago |
| 356 |
SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation
Juncheng Ma, Yuxuan Du, ... (+9 more)
|
|
cs.CV
|
0 |
1 month ago |
| 357 |
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
Kien T. Pham, I Chieh Chen, ... (+2 more)
|
|
cs.CV
|
0 |
1 month ago |
| 358 |
Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings
Theodor Westny, David Axelsson, ... (+2 more)
|
|
cs.CV
|
0 |
1 month ago |
| 359 |
Evidence-Backed Video Question Answering
Shijie Wang, Honglu Zhou, ... (+6 more)
|
|
cs.CV
|
0 |
18 days ago |
| 360 |
Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency
Zihan Su, Teng Hu, ... (+5 more)
|
|
cs.CV
|
0 |
18 days ago |
| 361 |
SVI360: Spherical Video Interpolation
Le-Kim Nguyen, Renato Martins, ... (+2 more)
|
|
cs.CV
|
0 |
18 days ago |
| 362 |
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
Muxin Liu, Xiaoyang Lyu, ... (+8 more)
|
|
cs.CV
|
0 |
18 days ago |
| 363 |
Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
Xin Zhang, Haochen Wang, ... (+3 more)
|
|
cs.CV
|
0 |
18 days ago |
| 364 |
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
Gong Sitong, Tianyu Yan, ... (+7 more)
|
|
cs.CV
|
0 |
18 days ago |
| 365 |
Parallax Portrait Matting
Xin Cai, Jiawen Chen, ... (+3 more)
|
|
cs.CV
|
0 |
18 days ago |
| 366 |
DynEval: Holistic Evaluations of T2I Generative Models in the Wild
Shyam Marjit, Dheeraj Baiju, ... (+4 more)
|
|
cs.CV
|
0 |
18 days ago |
| 367 |
Controlling Motion Transfer in Diffusion Transformers via Attention Heads
Sunyoung Jung, Jiwoo Park, ... (+4 more)
|
|
cs.CV
|
0 |
18 days ago |
| 368 |
MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration
Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos
|
|
cs.CV
|
0 |
18 days ago |
| 369 |
EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion
Cecilia Curreli, Florian Hofherr, ... (+4 more)
|
|
cs.CV
|
0 |
18 days ago |
| 370 |
OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields
Yanqin Jiang, Tengfei Wang, ... (+7 more)
|
|
cs.CV
|
0 |
19 days ago |
| 371 |
MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction
Jinqian Yang, Yichen Wu, ... (+5 more)
|
|
cs.CV
|
0 |
19 days ago |
| 372 |
NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices
Filip Pawlicki, Marcel Kańduła, ... (+2 more)
|
|
cs.CV
|
0 |
20 days ago |
| 373 |
On the Real-World Generalisability of Optical Flow Models
Petter Reijalt, Sander Gielisse, ... (+2 more)
|
|
cs.CV
|
0 |
20 days ago |
| 374 |
Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset
Zhiyan Zhang, Peipei Song, ... (+4 more)
|
|
cs.CV
|
0 |
20 days ago |
| 375 |
FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness
Shunsuke Yokokawa, Hironori Kasahara
|
|
cs.CV
|
0 |
20 days ago |
| 376 |
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Valentin Gabeff, Baptiste Maquignaz, ... (+6 more)
|
|
cs.CV
|
0 |
21 days ago |
| 377 |
Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition
Raza Yunus, Benjamin Ummenhofer, ... (+2 more)
|
|
cs.CV
|
0 |
21 days ago |
| 378 |
YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation
Jaekyun Ko, Byung Wan Lim, ... (+3 more)
|
|
cs.CV
|
0 |
21 days ago |
| 379 |
BeyondSight: Object Permanence for End-to-End Autonomous Driving
Sandro Papais, Letian Wang, ... (+3 more)
|
|
cs.RO
|
0 |
21 days ago |
| 380 |
VTaMo: Video-Text Alignment Model for Sign Language Translation
Junyi Hu, Zhewen He, ... (+3 more)
|
|
cs.CV
|
0 |
21 days ago |
| 381 |
Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
Yijie Qian, Juncheng Wang, ... (+7 more)
|
|
cs.CV
|
0 |
21 days ago |
| 382 |
Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation
Artheme Gauthier-Villar, Guodong Ding, Angela Yao
|
|
cs.CV
|
0 |
21 days ago |
| 383 |
On Locality and Length Generalization in Visual Reasoning
Pulkit Madan, Sanjay Haresh, ... (+4 more)
|
|
cs.CV
|
0 |
21 days ago |
| 384 |
Video Generation Models are General-Purpose Vision Learners
Letian Wang, Chuhan Zhang, ... (+10 more)
|
|
cs.CV
|
0 |
21 days ago |
| 385 |
Wat3R: Underwater 3D Geometry Learning without Annotations
Jiangwei Ren, Xingyu Jiang, ... (+5 more)
|
|
cs.CV
|
0 |
22 days ago |
| 386 |
ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
Fabio Tosi, Luca Bartolomei, ... (+2 more)
|
|
cs.CV
|
0 |
22 days ago |
| 387 |
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
Ruiqi Shen, Chang Liu, Henghui Ding
|
|
cs.CV
|
0 |
22 days ago |
| 388 |
Whareformer: Learning to Track What is Where in Long Egocentric Videos
Jacob Chalk, Saptarshi Sinha, ... (+3 more)
|
|
cs.CV
|
0 |
22 days ago |
| 389 |
HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations
YaQiao Dai, Renjiao Yi, ... (+4 more)
|
|
cs.GR
|
0 |
22 days ago |
| 390 |
Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies
Yuxiang Feng, Juncheng Wang, ... (+8 more)
|
|
cs.CV
|
0 |
22 days ago |
| 391 |
TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation
Hyeonseop Song, Seokhun Choi, Hoseok Do
|
|
cs.CV
|
0 |
22 days ago |
| 392 |
Dive Into the Implicit Biases of Low-rank Vision-language Alignment
Mingjia Shi, Shuo Wang, ... (+8 more)
|
|
cs.CV
|
0 |
22 days ago |
| 393 |
HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
Feng He, Zhenting Wang, ... (+5 more)
|
|
cs.CV
|
0 |
23 days ago |
| 394 |
MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG
Tao Zhang, Ziqi Zhang, ... (+8 more)
|
|
cs.CV
|
0 |
23 days ago |
| 395 |
Towards Real-World Wearable Motion Reconstruction
Andrea Boscolo Camiletto, Rishabh Dabral, ... (+4 more)
|
|
cs.CV
|
0 |
23 days ago |
| 396 |
EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning
Youtan Yin, Yanning Zhou, ... (+7 more)
|
|
cs.CV
|
0 |
23 days ago |
| 397 |
ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching
Yuhang He, Kai Zhang, ... (+3 more)
|
|
cs.CV
|
0 |
23 days ago |
| 398 |
AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
Kyuan Oh, Bumsoo Kim
|
|
cs.CV
|
0 |
23 days ago |
| 399 |
Ego-Human Motion Prediction with 3D-Aware LLM
Yujin Bae, Jaewoo Jeong, ... (+2 more)
|
|
cs.CV
|
0 |
23 days ago |
| 400 |
General Incomplete Multimodal Learning via Dynamic Quality Perception
Xiangyu Meng, Shicai Wei
|
|
cs.CV
|
0 |
23 days ago |