生成时间: 2026-08-04 18:44:58 (UTC+8); Arxiv 发布时间: 2026-08-04 20:00 EDT (2026-08-05 08:00 UTC+8)

今天共有 85 篇相关文章

Keyword: reinforcement learning

SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

SLM作为多代理路由器:一种渐进式SFT与强化学习方法

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning

基于最小圈速规划的自动驾驶车辆漂移的轨道引导层级强化学习

Deep Reinforcement Learning: From First Principles to Reasoning Models

深度强化学习:从基本原理到推理模型

DiffusionGemma Technical Report

DiffusionGemma 技术报告

Inference-Time Policy Alignment for Fair Reinforcement Learning

公平强化学习的推理时间策略对齐

Cross-Benchmark Generalization in Long-Horizon Agents

长视距代理中的跨基准推广

Physically Consistent SINDy (Sparse Identification of Nonlinear Dynamics) for Microgrid Identification and Real-Time Frequency Control

物理一致的SINDy(非线性动力学稀疏识别)用于微电网识别和实时频率控制

Verifier-Induced Support Reshaping in On-Policy Optimization

验证者诱导的支持在策略优化中的重塑

Geometric Self-Supervised Pre-training for Neural Combinatorial Optimization

神经组合优化的几何自监督预训练

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

RMSWeb:反射、失败模式挖掘与 Web 代理强化学习中的 Salvage-DS

Design and Implementation of Schwarz Information Criterion-Aided Intelligent Decentralized Resource Allocation in Dynamic LoRa Networks

动态LoRa网络中施瓦茨信息准则辅助智能去中心化资源分配的设计与实现

AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning

AReaL-DTE:用于在线代理强化学习的稀疏策略权重转移

SERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic Learning

SERL-SQL:文本转SQL强化代理学习的选择性事后诸葛亮提炼

TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

TaPR:反馈条件代码生成的测试感知策略细化

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教导紧凑型VLM在哪里寻找,哪里接地以获得有针对性

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

DocPO:通过定制化的步骤感知奖励推进文档策略优化

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

DexMani:人类驱动的灵巧旋转操作指导

LUT: Latent Utility Training for Visual Reasoning

LUT:视觉推理的潜在效用训练

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

在失败之处提炼:从适应性教师指导中恢复负面强化学习组的学习信号

Minute-Scale Training for Microrobot Navigation

微型机器人导航的微尺度训练

Bicycle Acrobatics with Reinforcement Learning

自行车杂技与强化学习

Gaokerena: A Small Persian Medical Language Model Family

Gaokerena:一个小型波斯医学语言模型家族

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

进展:覆盖引导的强化学习到训练搜索增强的LLM代理

Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

Search-GRT:引导式检索训练,优化复杂问答

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:迈向大型语言模型中罕见医疗病例的诊断辅助

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

OpenVLA-OFT的强化自举,用于新型机器人实现