2026-09-14(周一) 收录 4 篇论文:Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models;SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking;StepAudio 3 Gen Technical Report…
Robot foundation models achieve strong in-distribution performance but often degrade under visual distribution shifts. When learning to generate actions from pretrained visual representations, models ...
Post-training attention sparsification reduces the quadratic cumulative attention cost of pretrained Transformers by selecting a small set of context units (tokens or blocks) for each query. Existing ...
We introduce StepAudio 3 Gen, a general-purpose audio generation model that supports zero-shot text-to-speech (TTS), voice design, vocal generation, sound effects, music, vibe speech, and mixtures of ...
Part-aware 3D asset generation enables applications such as editing, articulation, simulation, and fabrication, yet existing methods can generate visually complete individual parts without ensuring th...