生成时间: 2026-08-10 17:24:15 (UTC+8); Arxiv 发布时间: 2026-08-10 20:00 EDT (2026-08-11 08:00 UTC+8)

今天共有 30 篇相关文章

Keyword: reinforcement learning

Evaluating XAI Support From A Hierarchical Reinforcement Learning Policy in Human-Agent Collaboration

在人机协作中评估基于分层强化学习策略的XAI支持

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

WebGrader:使用自我演进程序化评分器训练大语言模型进行网页开发

Flowing Through States: Neural ODE Regularization for Reinforcement Learning

流过状态:强化学习中的神经常微分方程正则化

MARS: A Monte Carlo Tree Search-based Adaptive and Responsive Scheduler

MARS:基于蒙特卡洛树搜索的自适应响应调度器

Vehicle routing problem using deep reinforcement learning - A case study about truck planning in the industry

利用深度强化学习的车辆路由问题——关于行业卡车规划的案例研究

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:战略对话代理的孤立双边强化学习

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Capek 0.5:以执行为中心的具身智能视觉语言模型

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?扩散模型的阶段引导逐步优化

Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence

从网络威胁情报中提取攻击技术的检索受限策略优化

EvoRIC: Reinforcement Learning Fine-Tuned LLM-empowered RAN Intelligent Control Toward Autonomous O-RAN

EvoRIC:强化学习 微调的 LLM 赋能的 RAN 智能控制,实现自主 O-RAN

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

过去:高效扩散模型的提示自适应采样终止

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

C2Dex:单目视频中灵巧操作的接触一致性重建与重定向

Beyond Isolation: Unlocking Reinforcement Learning Component Synergy for Sample-Efficient Continuous Control

超越隔离:释放强化学习组件协同效应,实现样本高效连续控制

How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning

那么,在哪里:多回合代理强化学习中的守信用动作到令牌分配

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:编码代理训练的差分中差分策略优化

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

以MARL为中心的参考架构,用于智能制造中的大型语言模型增强

Interpretable reinforcement learning with decision-tree pruning

可解释的强化学习与决策树修剪

Momba: Network Modernization Improves Multi-Objective Reinforcement Learning

Momba:网络现代化提升多目标强化学习

Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

在部分可观测性:封闭形式分析下,学习比策略类更受影响

Why Study Emergent Behavior When You Can Regulate It? Aligning Multi-Agent Systems with Reward Prediction

既然可以调节,为什么还要研究涌现行为?将多智能体系统与奖励预测对齐

Learning Long-Term Educational Investment Policies under Residential Sorting

学习长期教育投资政策,采用住宅分拣法

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

TEMPO:视觉-语言-行动模型的语义-动作解耦强化学习后训练

Learning Fault-Tolerant Locomotion with Adaptive Gait Timing

利用自适应步态时机学习容错移动

Aftab: A Comprehensive Benchmark of CNN Encoders and Advanced Value Functions in Parallelized Q-Networks

Aftab:并行Q网络中CNN编码器和高级值函数的综合基准测试

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

轨迹相对事后洞察提炼用于能动强化学习

LYRA: Label-Free Structural Synchronization and Resource Allocation for UAV Edge Networks

LYRA:无标签结构同步与无人机边缘网络资源分配

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

住院医师RL:模拟临床环境中的强化学习

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:培训大型语言模型代理以实现可靠假设检验

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

CreativeInstruct:可扩展教学LLM以平衡质量、创造力和多样性

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:端到端自动驾驶的简单世界行动模型

Keyword: diffusion policy

There is no result