生成时间: 2026-10-01 23:14:35 (UTC+8); Arxiv 发布时间: 2026-10-01 20:00 EDT (2026-10-02 08:00 UTC+8)

今天共有 72 篇相关文章

Keyword: reinforcement learning

A Moving-Horizon Approximate Branch-and-Reduce Method for Deep Classification Trees

一种用于深分类树的移动视界近似分支与缩减方法

SynIL: Leveraging Synergy for Offline Imitation Learning from Imperfect Demonstration Datasets

SynIL:利用协同效应从不完美演示数据集中进行离线模仿学习

On the Off-Policy Teacher in On-Policy Distillation

论非政策教师在非政策提炼中

From Codebase to Culprit (C2C): Reducing the Search Space for Bugs with Semantic Retrieval and Hierarchical Reinforcement Learning

从代码库到罪魁祸首(C2C):通过语义检索和层级强化学习减少错误搜索空间

Draft: A Parametric Tool for Robot Design Exploration

草图:机器人设计探索的参数化工具

ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

ArgGYM:结构化可可行推理的程序化、引擎验证基准

MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary

MOBA-VL:实时MOBA解说的事件定位多回合强化学习

PrivMeSA: Privacy-Aware Self-Evolving Multi-Agent System for Medicine via Local-Remote LLM Collaboration

PrivMeSA:通过本地远程大型语言模型协作实现的隐私感知自演进多智能体医学系统

Conditional Generation of Creative Chess Puzzles with Diffusion Models

利用扩散模型的创造性国际象棋谜题的条件生成

Reinforcement Learning with Complex (valued) Memories

复杂(有价值)记忆的强化学习

Vision-Language-Action Autonomous Driving Agent with Language-based Memory

视觉-语言-动作自动驾驶智能体,基于语言的记忆

TERRA: Terrain-Aware Reconstruction, Retargeting and Control for Musculoskeletal Locomotion

TERRA:地形感知重建、重定向与肌肉骨骼运动控制

Forward-Invariant Policy Classes for Safe Reinforcement Learning in Multicopter Control

多旋翼控制安全强化学习的前向不变策略类

In-Distribution Imagination for Model-Based Offline Reinforcement Learning

基于模型的离线强化学习中的分布式想象力

CEER2: Directional and Tunable End-Effector and Root Compliance for Humanoid Loco-Manipulation

CEER2:人形机动操作的方向性与可调末端执行器和根适应性

Code to Control: Synthesizing Parameterized Reactive Controllers

代码到控制:参数化无功控制器的综合

Learning to Route in Visual Space via Multi-Step Embedding Retrieval

通过多步嵌入检索学习在视觉空间中布线

Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics

得分更高,回答更差:通过协议级评分标准缓解基于评分标准的强化学习中的奖励黑客问题

OpenJev-RLCD: A Working RLCD Implementation

OpenJev-RLCD:一个可运行的RLCD实现

GeoNest: Learning to Select Failure-Aware Neighborhoods for the Irregular Knapsack Problem in a Circular Container

GeoNest:学习在圆形容器中选择故障感知邻域以解决不规则背包问题

DODGER: Safety-Guided Reinforcement Learning for Robot Navigation Among Dynamic Obstacles

DODGER:安全引导强化学习,用于动态障碍物中的机器人导航

Doing More with Less Tokens: Hierarchical Reinforcement Learning for Efficient Coding Agents

用更少的代币做更多事:高效编码代理的分层强化学习

PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

为行动块定价:具身强化学习中的物理关系学分作业

From Image Interpretation to Clinical Reasoning: Upstream Physician-Context-Aware Multimodal Learning with Causal Reinforcement Learning

从图像解读到临床推理:上游医生情境感知多模态学习与因果强化学习

Local-Minimum Escaper: Programmatic Subgoal Generation for Robust Navigation in Unknown Environments

局部最小逃逸器:在未知环境中实现稳健导航的程序化子目标生成

Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback

从腐败的人类反馈中学习的强化风险敏感强化

Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

通过Q分数匹配的顺序值恢复实现无环逆强化学习

OccluDex: Hierarchical 3D Visuo-Tactile Representation Learning for Egocentric Dexterous Manipulation under Self-Occlusion

OccluDex:层级三维视觉触觉表征学习,用于自我封闭下以自我为中心的灵巧操作

Frame Differential On-Policy Self-Distillation for Video Reasoning

视频推理中的帧差分策略自蒸馏

Structure-aware Reinforcement Learning for Protein Directed Evolution

蛋白质导向进化的结构感知强化学习

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

LexReward:一个基于分类法的法律语言模型奖励框架

Beyond Prediction: Steering VLM Agents with Retrospective World Modeling

超越预测:用回顾性世界建模引导VLM代理

T-Router: Learning Thalamic Routing for Reasoning with Parameter-Efficient Reinforcement Learning

T-路由器:通过参数高效强化学习学习丘脑路由进行推理

Reinforcing Multimodal Reasoning via Token-Level Perception-Grounded Advantage Estimation

通过代币级感知基础优势估计强化多模态推理

Aligning Thoughts with Answers: Probability Rewards to Tame Thinking Drift

将思想与答案对齐:概率奖励以驯服思维漂移

Learning Process Rewards via Reasoning State Propagation

通过推理状态传播获得学习过程奖励

QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs

QATFactory:一个多功能、部署对齐的框架,用于量化感知的训练与LLMs提炼

Rethinking Multi-Image Re-Representation in Multi-Image Understanding

重新思考多图像理解中的多重图像再表征

EHR-RobustGym: Benchmarking and Training Agents for Robust Clinical Reasoning

EHR-RobustGym:针对强健临床推理的基准与培训代理

SkillFM: Generating Skills for LLM Agents via Latent Flow Matching

SkillFM:通过潜在流匹配为LLM代理生成技能

From Search to Signal: Online Post-Training in Automatic Heuristic Design

从搜索到信号:自动启发式设计在线后期培训

No Task Vector Is an Island: A Comprehensive Study on the Composability of Task Vectors from On-Policy Distillation

《没有任务向量是孤岛:一项关于任务向量可组合性的综合研究》——通过策略提炼

From Imitation to Reward Discovery: On-Policy Warmup for Agentic RL

从模仿到奖励发现:代理强化学习的政策预热

CAST: Causal Advantage-Structured Training with Spatially Grounded Compositional Rewards for Diffusion Models

CAST:因果优势结构化训练,空间基础的组合奖励,适用于扩散模型

CATCH: A Controllable Analysis Testbed for Reward Hacking in Coding RL

注意点:一个可控分析测试平台用于编程强化学习中的奖励黑客

From Given to Gathered Evidence: Agentic Learning for Longitudinal Medical Reasoning

从既有到收集证据:纵向医学推理中的能动学习

Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?

跳出框架思考:语言模型能否选择性依赖外部指导?

GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

GroundingPI:面向具视觉基础的物理智能基础模型

ChronoGraph: Functional 4D Scene Graphs with Vision-Language Models for Interaction Understanding and Grounded Planning

ChronoGraph:功能性四维场景图,采用视觉语言模型,用于交互理解和扎根规划

Validity-Preserving Hierarchical RL for Joint Routing and Switch Placement in EDA

EDA中用于联合路由和交换机布置的保效性层级强化学习

Riemannian Flow Models with Reinforcement Learning for Molecular Crystal Structure Prediction

黎曼流模型与强化学习用于分子晶体结构预测

Darpan: A Digital Twin Framework for the Next-Generation Computing Continuum

Darpan:下一代计算连续体的数字孪生框架

KUAISHOU Explorer LLM-Rec Challenge 2026: Reasoning Generative Recommendation

快手探索者LLM-Rec挑战2026:推理生成推荐

Learning Steganography Is Easy, Learning Steganographic Reasoning Is Hard

学习隐写很容易,但学习数字写法推理很难

RL-Guided PAC-NMPC for Probabilistically-Safe Perception-Based Navigation in Unknown Environments

用于未知环境中基于概率安全的基于感知的RL导引PAC-NMPC

Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding

多线总线保持的完成感知跨保真度离线到在线强化学习

GrammarRL: Effective Grammar-Constrained Decoding via Reinforcement Learning

GrammarRL:通过强化学习实现的有效语法约束解码

Grounding with Confidence: Controllable Generative Video Temporal Grounding

自信接地:可控生成视频时间接地

Do Better Goal Representations Improve Goal-Conditioned Reinforcement Learning?

更好的目标表征是否能改善目标条件强化学习?

Patient-Centered Treatment Planning for Chronic Multimorbidity: A Hierarchical Reinforcement Learning Framework for Preference Modeling

慢性多病患者的以患者为中心治疗计划:偏好建模的层级强化学习框架

Unlearnable, or Unmeasured? On the Reliability of Difficulty Labels in RLVR

不可学,还是无法测量?关于RLVR难度标签的可靠性

Tactile Curiosity Drives Robot Interaction

触觉好奇心驱动机器人互动

Role-Adaptive Policy Optimization for Offline Reinforcement Learning

离线强化学习的角色自适应策略优化

Reinforcement Learning-Guided Graph Transformations for SpTRSV Optimization

SpTRSV优化中的强化学习引导图变换

Social-WM: Safety-Aware Latent World Models for Robot Social Navigation

Social-WM:机器人社会导航的安全意识潜世界模型

MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories

MemLife:策划与推理长期自我中心的视频记忆

PhantomEnvironments: Training LLM Agents in Fictional Worlds

PhantomEnvironments:虚构世界中的大型语言模型代理培训

EviRover: Reinforcing Agentic Perception Beyond a Glance

EviRover:强化超越一瞥的智能感知

Semifactual Credit-Augmented Policy Optimization

半事实性信用增强政策优化

Keyword: diffusion policy

Conditional Generation of Creative Chess Puzzles with Diffusion Models

利用扩散模型的创造性国际象棋谜题的条件生成

Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching

通过Q分数匹配的顺序值恢复实现无环逆强化学习

Text-to-3D Policy: Fine-Grained Language-Behavior Alignment for Unseen Specification Generalization

文本到三维策略:用于看不见规范泛化的细粒度语言-行为对齐