生成时间: 2026-10-02 22:34:05 (UTC+8); Arxiv 发布时间: 2026-10-02 20:00 EDT (2026-10-03 08:00 UTC+8)

今天共有 76 篇相关文章

Keyword: reinforcement learning

Integrating Fairness and Explainability in a Multiple Instance Reinforcement Learning System

在多实例强化学习系统中整合公平性和可解释性

Uncertainty-Aware RL-Controlled Adaptive 3D Mapping

不确定性感知的强化学习控制自适应3D映射

A Mobile Agent-Based Hierarchical Reinforcement Learning Framework for Energy-Balanced Data Collection and Wireless Charging in WSN

基于移动代理的分层强化学习框架,用于WSN中的能量平衡数据收集和无线充电

DriftOPD: Sequence-Level Reverse-KL Distillation for One-Step VLA Policies

DriftOPD:用于单步VLA策略的序列级逆KL蒸馏

The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning

最薄弱环节:用最坏情况的约束强化学习提炼LLM推理

DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation

DexPolicy:轨迹引导灵巧操作的计划探索

T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

T2SPO:轨迹到步进策略优化,用于代理强化学习

MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

MatrixReward:来自评分标准矩阵的开放式生成奖励

Whole-Body Aerial Grasping and Lifting via Partial Visual Observations

通过部分目视观察实现全身空中抓取和举起

No One Architecture Fits All: A Cross-Environment Evaluation of Hierarchical Red Team Agents

没有一种架构适用于所有人:跨环境层级红队代理评估

Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

让稀疏奖励发挥作用:多奖励强化学习的密度感知奖励聚合

Towards Hierarchical Cyber Defense with Large Language Models: From Planning to Execution

迈向利用大型语言模型实现分层网络防御:从规划到执行

ALER: Adaptive Learnable Experience Rewriting for Reinforcement Learning

ALER:强化学习的自适应可学习体验重写

Exploring More, Reasoning Better: Stepwise Risk-Sensitive GRPO for Diffusion Language Models

深入探索,更好地推理:扩散语言模型的分步风险敏感GRPO

Meta-Multi-Agent Reinforcement Learning for Fast Adaptation of Interactive Policies with Applications to Autonomous Driving

元多智能体强化学习,用于快速适应交互式策略,并应用于自动驾驶

Scalable Multi-Task Inverse Reinforcement Learning

可扩展多任务逆向强化学习

Learning Goal-Reaching Quasimetric Geometry From Finite-Time Reachability

从有限时间可达性学习目标达成的准几何

Event-Triggered Practical Fixed-Time Integral Reinforcement Learning for Unknown Nonlinear Systems

未知非线性系统的事件触发实用固定时间积分强化学习

SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

SHARPO:能动强化学习的分段级学分作业

Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

学习多重时间尺度的目标条件化强化学习

Cross-Benchmark Transfer from RL on Agentic Coding Tasks

从强化学习在代理编码任务上的跨基准转移

Sharpen Before You Adapt: Data-Free Entry-State Sharpening for Test-Time Reinforcement Learning

先磨砺再适应:无数据进入状态磨砺,用于测试时强化学习

eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

eRLT:通过动作相关令牌路由实现高效的VLA强化学习

Adapter Thickets: Splitting an RLVR Budget Beats Concentrating It

适配器丛林:分拆RLVR预算总比集中它好

Calibration-risk routing for controlled world-model adaptation

受控世界模型适应的校准风险路由

FutureWorlds: Learning Robotic World Models from Alternative Futures

未来世界:从另类未来学习机器人世界模型

Probe with Participation Trophies: Random-Reward RL as a Probe of LLM Capability

带参与奖杯的探测器:随机奖励强化学习作为大型语言模型能力探测器

Improving Math Reasoning through Value-guided Informative Search

通过价值引导的信息性搜索提升数学推理能力

MASkillBlender: Decentralized Whole-Body Coordination for Multi-Humanoid Loco-Manipulation via Skill Blending

MASkillBlender:通过技能融合实现多类人机车操控的去中心化全身协调

Does Scaling Reinforcement Learning Really Require More Training?

扩展强化学习真的需要更多培训吗?

My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

我的错:自我诊断作为自我演进能动强化学习中的学分分配

Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

依赖感知奖励塑造用于能动强化学习

Flow Matching Reinforcement for 3D Mesh Generation via Dynamic Homing Optimization

通过动态归导优化实现三维网格生成的流量匹配强化

Context-Aware Error Mitigation Orchestration for Hybrid Quantum Reinforcement Learning on NISQ Systems

NISQ系统上混合量子强化学习的上下文感知错误缓解编排

ColoACT: Multi-Cue Action Chunking for Smooth Autonomous Colon Navigation on a Self-Propelled Endoscopic Robot

ColoACT:多提示动作分块技术,实现自控内窥镜机器人上的平稳自主结肠导航

PROMO: Preference-conditioned Multi-Objective Reinforcement Learning for Quadrupedal Robots

PROMO:四足机器人的偏好条件多目标强化学习

IQS-BO: In-Context Query Selection for Bayesian Optimisation

IQS-BO:贝叶斯优化中的上下文查询选择

PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

PPO-HRAP:采用混合体制感知政策进行风险控制交易的近端政策优化

Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?

在近端策略优化中重复使用过去样本:何时以及如何有效?

DRL-driven RAN Slicing Management: A V2X-oriented Approach In Multi-service Scenarios

基于DRL驱动的RAN切片管理:多服务场景下的面向V2X方法

Rethinking Probability-Based Reinforcement Learning From Posterior Concentration

重新思考基于概率的强化学习——从后期集中

Sharpening Tax in Post-Training

培训后税收的提升

Decision Titan: Test-Time Training for Long-Term Memory in Offline Reinforcement Learning

决策泰坦:离线强化学习中的长期记忆测试时训练

Towards Optimal Policy Improvement

迈向最佳政策改进

Continual Reinforcement Learning with Neuroevolution

神经进化持续强化学习

ReCo: Response-Consistent Locomotion with Policy-Aware MPC for Legged Manipulation

ReCo:与政策感知MPC配合响应一致的腿部操控

Iterative Policy Refinement through Semantic Rollout Analysis

通过语义推广分析进行迭代策略优化

MiLoop: Selective Memory Propagation for Neural Combinatorial Optimization

MiLoop:选择性记忆传播用于神经组合优化

Architectural Sampling: Test-Time Scaling via Computational Diversity in Frozen Vision-Language Models

架构采样:通过计算多样性在冻结视觉语言模型中进行测试时间尺度

Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning

具有可执行验证器的函数结构化强化学习数学推理

Q-Learning for Reachability in MEC-Free MDPs

无MECMDP的Q-可达性学习

iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

iADD:提升扩散政策优化中的对齐与多样性

LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification

LineupRL:通过字幕到系列识别实现时间序列字幕的可验证强化学习

Flowing Faster to Coordinate: One-Step Online Multi-Agent Flow Policies

更快的协调流程:一步在线多代理流程策略

Selection-Based Structured Reasoning: Toward Efficient Multimodal Search Agents

基于选择的结构化推理:迈向高效的多模态搜索代理

Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

异步LLM后培训:群质量上限与收敛分析

Same Reward, Different Skills: When Multimodal RL Learns to Look

同样的奖励,不同的技能:当多模态强化学习学会观察时

Mapping the RAG Landscape: A Four Axis Taxonomy of Efficiency, Defense, Interactivity, and Reasoning

绘制RAG格局:效率、防御、交互性与推理的四轴分类法

Do Your Own Research: Learning to Forecast by Learning to Search

自己做研究:通过学习搜索来学习预测

Token-Level Video Reinforcement Learning

令牌级视频强化学习

Bellman Meets Lyapunov: Unsupervised Reinforcement Learning via Mastering Chaos

贝尔曼遇见柳雅普诺夫:通过掌握混沌进行无监督强化学习

On Language Drift during RLVR Post-Training

关于RLVR培训后期的语言漂移

Controllable Multi-label Video Safety Detection via Adaptive Tversky Policy Optimization

通过自适应Tversky策略优化实现可控多标签视频安全检测

SPHERE: Adaptive VR Indoor Scene Generation via LLM-Enhanced Spatial Preference Learning and Human-in-the-Loop RL

SPHERE:通过LLM增强的空间偏好学习和人机循环强化学习实现自适应VR室内场景生成

CARM: Cancellation-Aware Response Masking for LLM Reinforcement Learning

CARM:用于大型语言模型强化学习的取消感知响应掩蔽

Homomorphic Advantage Operator: Stabilizing Reinforcement Learning Under Fully Homomorphic Encryption Constraints

同态优势算符:在完全同态加密约束下稳定强化学习

Finetuning with Sampling: SFT Learns Better Than You Think

采样微调:SFT学习效果比你想象的更好

Faynt: Scaling and Optimizing Policies for Competitive Melee

Faynt:为竞技近战调整与优化策略

When Do Intrinsic Rewards Lead to Exploration?

内在奖励何时会引发探索?

AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents

AutoCompact:学习何时在长视野编码代理中对上下文进行压缩

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

OmniSeek:多回合视听推理的原生工具集成

Generative modeling of intrinsically disordered protein regions by reinforcing sparse autoencoder features

通过强化稀疏自编码器特征,生成建模本质无序的蛋白质区域

HiPhy: Hierarchical Alignment for Physically-Plausible Multi-Principle Video Generation

HiPhy:物理上可行多原理视频生成的层级对齐

FERPO: Forward Entropy-Regularized Policy Optimization

FERPO:前向熵正则化策略优化

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

KaliBench:Kali Linux 上网络安全工具使用的细粒度基准测试,提供无运行时且可验证的奖励

Keyword: diffusion policy

iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

iADD:提升扩散政策优化中的对齐与多样性