生成时间: 2026-08-26 16:44:09 (UTC+8); Arxiv 发布时间: 2026-08-26 20:00 EDT (2026-08-27 08:00 UTC+8)

今天共有 27 篇相关文章

Keyword: reinforcement learning

Generating Biomedical Fact-Checking Reports with RL-Enhanced Agentic Search

利用强化学习增强的代理搜索生成生物医学事实核查报告

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

学习在等待中行动:在推理延迟下通用机器人策略的强化分析

AI Finds A Way

人工智能找到出路

Evolutionary Recurrent Decision Model in Developing Adaptive and Maladaptive Behaviors

适应性与不良适应性行为发展中的进化循环决策模型

CoDrift: Compositional Drifting for Offline Reinforcement Learning

CoDrift:离线强化学习中的组合漂移

Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment

算法影响揭示了隐藏的社会选择结构——一致性

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Android GUI 代理对运行时异常有强健性吗?AnTrap:在动态对抗环境中评估代理

AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL

展望:环境增强蒸馏的适应性后见明,适用于能动强化学习

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

通过错误代码驱动的测试用例综合和密集奖励塑造实现强健代码强化学习

Robust Data-Collection Policy Learning for Low-Variance Online Policy Evaluation

低方差在线策略评估的稳健数据收集策略学习

Task-Adaptive Rubrics for GUI Reward Modeling

GUI奖励建模的任务自适应评分标准

CARO: Contact-Agnostic Residual Observation for Zero-Shot Robust Quadruped Locomotion

CARO:零射强健四足行走的接触无关残留观测

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:代理保障中安全-策略调用的强化学习

Contrastive Branch Policy Optimization

对比分支策略优化

FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision

FARCA:事实对齐、可靠性意识、具事实监督的强化学习学分作业

Reinforcement Learning-Guided Evolutionary Policy Optimization for Preference-Adjustable Heterogeneous Agile Earth Observation Satellite Scheduling

强化学习引导的进化策略优化,适用于偏好可调异构敏捷地球观测卫星调度

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

WarpSAC:通过重新思考探索与开发,迈向可扩展的非政策强化学习巅峰

NeuralParker: A Reinforcement Learning Planner for Irregular Parking Environments

NeuralParker:针对不规则停车环境的强化学习规划器

Joint Optimization of Tool Creation and Use for Large Language Model Agents

大型语言模型代理工具创建与应用的联合优化

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO:多轮服务代理中信用分配的影响力感知策略优化

EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation

EVEREST:城市社会语义分割的内生视觉语言强化推理探索

On-Policy Self-Distillation in Diffusion Models

扩散模型中的政策自提纯

EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents

EviGraph:迈向信息寻求智能体的可验证证据构建

On-policy Distillation with Verifiable Reward

带有可验证奖励的保单内提炼

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:强化学习代理的可验证技能演进

Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement

通过局部增强偏好和表示解缠改进跨问题车辆路由

SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

SPO++:异步代理强化学习的流对齐策略优化

Keyword: diffusion policy

There is no result