生成时间: 2026-09-24 21:20:52 (UTC+8); Arxiv 发布时间: 2026-09-24 20:00 EDT (2026-09-25 08:00 UTC+8)

今天共有 33 篇相关文章

Keyword: reinforcement learning

On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

关于多目标强化学习中事后诸葛亮再标注的偏好覆盖崩溃

WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps

这到底是怎么回事?!无模拟强化学习,使用Wasserstein倾斜流程图

Reinforcement Learning with Decomposed Subtasks

带分解子任务的强化学习

HiRE: Hindsight Reward Editing for Policy Finetuning

招聘RE:政策精细化的事后诸葛亮奖励编辑

Banana Kick: Response-Informed Skill Evolution for Humanoid Soccer

香蕉踢:人形足球的反应导向技能进化

Hunyuan-A13B Technical Report

魂源-A13B技术报告

FairTest: Search-Based Fairness Testing for Multi-Agent Reinforcement Learning Systems

FairTest:多智能体强化学习系统的基于搜索的公平性测试

Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

将安全转化为能力:通过安全过滤强化学习实现最小可利用的机器人政策

Evolving Inspectable O-RAN Slicing xApps with LLMs

进化的可检验O-RAN切片x应用与LLMs。

EvoAudio: Recursive Self-Improvement for Audio Understanding

EvoAudio:递归自我提升以提升音频理解

Quantum Reinforcement Learning for Cost and Delay Tradeoffs in Quantum Cloud Orchestration

量子云编排中成本与延迟权衡的量子强化学习

BEE: Intervention-Adaptive Real-World Reinforcement Learning with Vision-Language-Action Models

BEE:带有视觉-语言-行动模型的干预-自适应现实世界强化学习

MDRC: A Deployable State-Recovery Defense for Traffic Signal Control under Sensor Corruption

MDRC:一种可部署的状态恢复防御,用于传感器损坏下的交通信号控制

EBRL: Asynchronous Embodied RL by Multi-Grained Resource Management

EBRL:多粒度资源管理下的异步具身强化学习

DCRL: Decoupling and Coupling Reinforcement Learning via Policy-Reward Manifold Alignment

DCRL:通过策略-奖励流形对齐实现解耦与耦合强化学习

A DRL-Driven Optimization of RAN Slice Resource Partitioning for V2X SLA Compliance in 5G Networks

基于DRL驱动的RAN切片资源分区优化,以实现5G网络中V2X SLA合规性

Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization

具有风险敏感性和批判者一致性正则化的强健对抗强化学习

SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving

SkillGym:将人类技能内化到大型语言模型中以实现现实世界问题解决

Limiting-Kernel Q($λ$): Bridging Short and Long Horizons

极限核 Q($λ$):连接短视野与长视野

Satisfaction Is Not Explanation: Auditing Vacuity and Training Influence in Temporal-Logic-Guided Reinforcement Learning

满意不是解释:审计空缺与训练对时间逻辑引导强化学习的影响

Categorical Internalisation of Environmental Groupoids for Generalisable POMDP Solving

环境群类的分类内化以实现可推广的POMDP求解

From Reasoning Strings to Partial Orders: Verifier-Certified Rule Transport through Quotient Policy Optimization

从推理字符串到部分命令:通过商策略优化实现验证者认证的规则传输

Learning What to Activate: Combinatorial Capability Allocation for Long-Horizon Multimodal Agents

学习激活内容:长视野多模态智能体的组合能力分配

PCQC: Privileged Counterfactual Question Credit for Multi-Turn Medical Dialogue

PCQC:多回合医学对话的特权反事实问题署名

Learning a Speed-adaptive Hip Exoskeleton Control Policy Via Sim-to-real Reinforcement Learning

通过模拟到现实强化学习学习速度自适应髋外骨骼控制策略

Curriculum Learning with GNN-based Reinforcement Learning for Job Shop Scheduling

基于GNN的强化学习课程学习,用于工坊排班

RL Starts before RL: On Policy Distillation for Better Reinforcement Learning

强化学习先于强化学习:关于策略提炼以实现更好强化学习

Dissecting Advantage-Guided Post-Training for Vision-Language-Action Policies

剖析以优势为导引的愿景-语言-行动政策培训后

Finite-Sample Probabilistic Safety Certification for AI-Based Grid-Edge Coordination

基于人工智能的网格-边际协调有限样本概率安全认证

LEAP-CBF: A Safety Filter for Uncertain Systems with Least-Effort Adversarial Potentials

LEAP-CBF:针对不确定且具备最小对抗潜力的安全过滤器

ForgetMimic: Motion Unlearning for Reinforcement Learning Humanoid Control

遗忘模仿者:动作解学用于强化学习类人生物控制

When and Where to Trust the Teacher: Unifying On-Policy Distillation and GRPO through Entropy-Calibrated Credit Assignment

何时何地信任教师:通过熵校准学分作业统一政策提炼与GRPO

Tractable Reinforcement Learning for Full Class of Signal Temporal Logic Specifications Using Spatiotemporal Tube Reward

使用时空管奖励的可处理强化学习,适用于全类信号时序逻辑规范

Keyword: diffusion policy

There is no result