Skip to content

AI论文速递 2026年07月21日(HuggingFace Daily Papers)

数据来源:https://huggingface.co/papers 采集时间:2026-07-21

📌 重点关注

  1. S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | arXiv【重点关注】 We present S1-Omni, a unified multimodal reasoning model for scientific under... 💡 统一多模态科学推理,覆盖200个任务,AI4S从碎片化走向大一统
  2. Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories | arXiv【重点关注】 We present Xiaomi-Robotics-1, a foundational vision-language-action (VLA) mod... 💡 10万小时真实轨迹训练VLA,具身智能从实验室走向实用化的里程碑
  3. Environment-free Synthetic Data Generation for API-Calling Agents | arXiv【重点关注】 Training API-calling large language model (LLM) agents demands massive amount... 💡 无需真实环境生成API调用数据,Agent训练门槛直接打穿

📋 其他值得关注

  1. RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination | arXiv — Embodied cognition requires agents to connect high-level task reasoning with ...
  2. Hierarchical Denoising For Multi-Step Visual Reasoning | arXiv — Video models are evolving into vision foundation models, yet they still lack ...
  3. GRASP: GRanularity-Aware Search Policy for Agentic RAG | arXiv — Agentic retrieval-augmented generation (RAG) extends static RAG by allowing l...
  4. RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources | arXiv — Skills are a useful abstraction for software agents, turning human and agent ...
  5. RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM | arXiv — Graph retrieval-augmented generation (GraphRAG) enhances large language model...
  6. VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance | arXiv — Visually impaired individuals (VIIs) encounter significant daily challenges d...
  7. On-Policy Delta Distillation | arXiv — On-policy distillation is an alternative post-training method in reinforcemen...