生成时间: 2026-08-21 16:40:57 (UTC+8); Arxiv 发布时间: 2026-08-21 20:00 EDT (2026-08-22 08:00 UTC+8)

今天共有 21 篇相关文章

Keyword: reinforcement learning

Learning the Right Abstraction: Neural Reduced Dynamics for Complex Robot Control

学习正确的抽象:复杂机器人控制的神经约化动力学

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

SSR-GRPO:将监督和语义ID整合进强化学习,实现电子商务中的密集检索

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

支架思维:优化潜在视觉目标表征以实现多模态推理

RIPE++: Reinforced Keypoint Learning from Positive Pairs Only

RIPE++:仅从正对强化关键点学习

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:基于图的策略优化的里程碑推断,支持长视野LLM代理的图化策略优化

ADAPT: Physics-Aware Diffusion-based World Models for Adaptive Predictive Transferable HVAC Control

ADAPT:基于物理感知扩散的世界模型,用于自适应预测可转移暖通空调控制

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

通过学习型MDP实现自适应概率屏蔽,实现安全强化学习

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:针对代理强化学习的单次推出自回归策略优化

EnvHarness: Awakening Static Worlds for Agent Learning

EnvHarness:为代理学习唤醒静态世界

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:VLM引导探索VLA政策

MILD: Tractable Terrain Modeling for Learning Improved Bipedal Locomotion on Deformable Surfaces

MILD:可处理地形建模,用于学习改进的双足行走在可变形表面上

Learning Highly Dynamic Skills Transition for Quadruped Jumping Through Constrained Space

学习四足跳跃在有限空间中的高度动态技能过渡

End-to-end Early Classification of Time Series in Non-Stationary Environments

非定流环境中时间序列的端到端早期分类

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成,用于高效多智能体通信拓扑设计

Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

多智能体编排结合LLMs的常识推理能力,用于自动驾驶

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

DARS:双层次学分作业强化学习,结构化推理用于基于指令的图像编辑

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流,用于机器人操作中的离线强化学习

Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

学习何时思考:测试时间计算分配的自适应推理

MidTool: Mid-training Data Synthesis for Agentic Tool Use

MidTool:用于代理工具的中训练数据综合

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:基于核对清单的奖励学习,用于患者导向的医疗报告解读

Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models

Swift-Image:探索紧凑统一图像生成模型的性能前沿

Keyword: diffusion policy

There is no result