AI论文速递 2026年07月21日(HuggingFace Daily Papers)¶
数据来源:https://huggingface.co/papers 采集时间:2026-07-21
📌 重点关注¶
- S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | arXiv — 【重点关注】 We present S1-Omni, a unified multimodal reasoning model for scientific under... 💡 统一多模态科学推理,覆盖200个任务,AI4S从碎片化走向大一统
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories | arXiv — 【重点关注】 We present Xiaomi-Robotics-1, a foundational vision-language-action (VLA) mod... 💡 10万小时真实轨迹训练VLA,具身智能从实验室走向实用化的里程碑
- Environment-free Synthetic Data Generation for API-Calling Agents | arXiv — 【重点关注】 Training API-calling large language model (LLM) agents demands massive amount... 💡 无需真实环境生成API调用数据,Agent训练门槛直接打穿
📋 其他值得关注¶
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination | arXiv — Embodied cognition requires agents to connect high-level task reasoning with ...
- Hierarchical Denoising For Multi-Step Visual Reasoning | arXiv — Video models are evolving into vision foundation models, yet they still lack ...
- GRASP: GRanularity-Aware Search Policy for Agentic RAG | arXiv — Agentic retrieval-augmented generation (RAG) extends static RAG by allowing l...
- RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources | arXiv — Skills are a useful abstraction for software agents, turning human and agent ...
- RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM | arXiv — Graph retrieval-augmented generation (GraphRAG) enhances large language model...
- VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance | arXiv — Visually impaired individuals (VIIs) encounter significant daily challenges d...
- On-Policy Delta Distillation | arXiv — On-policy distillation is an alternative post-training method in reinforcemen...