AI论文速递 2026年08月10日(HuggingFace Daily Papers)¶
数据来源:https://huggingface.co/papers 采集时间:2026-08-10
📌 重点关注¶
- Douyin Multimodal Embedding Model Technical Report | arXiv — 【重点关注】 Multimodal representation learning is a cornerstone of modern AI. By encoding... 💡 抖音出品多模态嵌入方案,工程实战参考价值高
- OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models | arXiv — 【重点关注】 Computer-using agents (CUAs) are advancing rapidly across the digital world. ... 💡 CUA评估标准化方案,Agent开发可参考其评测维度
- SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding | arXiv — 【重点关注】 Understanding 3D scenes is fundamental to embodied intelligence, requiring jo... 💡 动态模态编排做3D理解,端侧AI落地新思路
📋 其他值得关注¶
- From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models | arXiv — Economic World Models (EWMs) are generative economic models that simulate how...
- Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval | arXiv — Unified multimodal retrieval aims to identify candidates that satisfy complex...
- Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains | arXiv — Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major...
- Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills | arXiv — Robot learning is splitting into two bets: policies that bake competence into...
- StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding | arXiv — Deploying autonomous multimodal agents in continuous, real-world environments...
- ChronoVision: Temporal Reasoning via Latent State Reconstruction | arXiv — Multimodal large language models excel at passive perception but struggle wit...
- FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory | arXiv — GUI agents must remember both useful experience from earlier tasks and unfini...