生成时间: 2026-09-22 21:15:02 (UTC+8); Arxiv 发布时间: 2026-09-22 20:00 EDT (2026-09-23 08:00 UTC+8)

今天共有 78 篇相关文章

Keyword: reinforcement learning

GRRR: The Geometry of Reshaping, Rotation, and Routing in Decoder LLM post-training

GRRR:解码器LLM后期训练中的重塑、旋转与布线几何

Beyond Task Completion: Training Capable and Safe Computer-Use Agents

超越任务完成:培训具备能力且安全的计算机使用代理

A Pinch of SFT, A Dash of RL: When Reinforcement Learning Helps Long-Horizon Advertising Agents

一点SFT,一点强化学习:当强化学习帮助远景广告代理时

Team DArgk at the 2026 ELOQUENT lab for evaluating generative language model quality: Residuals of Humanity: AI Detection Evasion via GRPO Fine-Tuning

2026年ELOQUENT生成语言模型质量评估实验室的DArgk团队:人类残差:通过GRPO微调实现AI检测规避

CNA: An AI-Oriented Comprehensive Normalized Assessment for Healthy Status and Application to Optimize RRT Strategies by Reinforcement Learning

CNA:一种基于人工智能的综合归一化评估,旨在健康状态及通过强化学习优化RRT策略的应用

Seeing Through Conflicts: Improving Instruction Hierarchy Alignment in Vision-Language Models

洞察冲突:改善视觉语言模型中的指令层级对齐

RS-Claw-Evolution: Environment-Feedback-Driven Evolution for Lightweight Remote Sensing Agents in Long-Horizon Tasks

RS-Claw-Evolution:环境反馈驱动的轻量级遥感智能体在长视距任务中的演进

CHOREO: Every Humanoid Skill as a Trajectory

编舞:每个类人生物技能作为轨迹

Visual Graph Reasoning via Knowledge Compilation

通过知识编译进行可视化图推理

Learning and Control Beyond Linearity: Towards a Non-asymptotic Theory for Bilinear Systems

超越线性学习与控制:迈向双线性系统的非渐近理论

Learning Control Policies from Heterogeneous Multi-Horizon Time Series in Battery Energy Management Systems

从电池能源管理系统中的异构多视界时间序列学习控制策略

Augmenting PID Control with Deep Reinforcement Learning: A Hybrid Approach to the Industrial Benchmark

用深度强化学习增强PID控制:工业基准的混合方法

AutoGym: Blueprint-First Generation of Verifiable Agent Gyms

AutoGym:蓝图——第一代可验证代理道馆

Autonomous Model Lifecycle Management for Digital Twin-Based Manufacturing Control

基于数字孪生的制造控制自主模型生命周期管理

UBA-ORL: Unlearning-Activated Backdoor Attacks on Offline Reinforcement Learning

UBA-ORL:离线强化学习中的“去学习激活”后门攻击

ProcessLight: Process Supervision for Large Language Model Based Traffic Signal Control

ProcessLight:用于大型语言模型的交通信号控制过程监督

Robust Market Making with Hawkes Order Flow and Price Impact via Adversarial Reinforcement Learning

通过对抗强化学习,霍克斯订单流与价格影响实现强有力的做市

ARCGym: Benchmarking Deep Reinforcement Learning in Autonomous Robotic Colonoscopy

ARCGym:自主机器人结肠镜中深度强化学习的基准测试

Personalized Federated Reinforcement Learning via Model-Agnostic Meta-Learning: Convergence of Exact and Hessian-Free Meta-Policy Gradients

通过模型无关元学习实现的个性化联合强化学习:精确元政策梯度与无黑森元政策梯度的收敛

ForceRFT: Refining VLA Actions through Force-Guided Residual Reinforcement Learning

ForceRFT:通过力引导残留强化学习优化VLA动作

AoI-Driven Hierarchical Learning for Cooperative Resource Sharing in Multi-Operator UAV Networks

多运营商无人机网络中基于AoI驱动的协作资源共享分层学习

Towards Full Pipeline FP8 Reinforcement Learning for LLMs

迈向大型语言模型的全流水线FP8强化学习

Prioritized Rollouts for Efficient World Model-based Vision-Language-Action Policy Optimization

优先推广以实现高效的基于世界模型的愿景-语言-行动政策优化

Reproducibility Challenges in Computational Network Science: Evidence, Causes, and Recommendations

计算网络科学中的可重复性挑战:证据、原因与建议

Computationally efficient safe exploration in reinforcement learning

强化学习中的计算高效安全探索

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

RewardVerse:基于评分标准的策略优化,用于视频奖励建模

General Collaborative Intelligence: Architecting Cognition for Resilient Multi-Agent Ecosystems

通用协作智能:为韧性多智能体生态系统构建认知

DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale

DeepSeek 弹性计算(DSec):一个用于大规模有效代理训练的沙盒基础设施

Attributable Post-Rationalization in RAG Citations: A Controlled Reproduction and an RLVR Comparison

RAG引用中的归因性后合理化:受控复制与RLVR比较

Verti-WM: A Physics-Aided Exteroceptive World Model for Off-Road Reinforcement Learning

Verti-WM:一种物理辅助的外感知世界模型,用于越野强化学习

Provably Efficient Reinforcement Learning in Continuous-Time Episodic MDPs with Poisson Decision Epochs

连续时间情节MDP中具有泊松决策纪元的可证明高效强化学习

Proximal Residual Value Functions for Consistent Planning and Real-Time Execution

用于一致规划和实时执行的近端残值函数

Latent Telepathy: Multi-Robot Communication with Self-Supervised Perceptual Latents

潜在心灵感应:多机器人与自我监督的感知潜能交流

The Evidence Ladder for Reinforcement Learning in Healthcare: From Retrospective Policies to Trusted Interventions

医疗强化学习的证据阶梯:从回顾性政策到可信干预

One to More, More to One: Category-Aware Iterative Expert Training for Software Engineering Agents

一对多,多到一:软件工程代理的类别感知迭代专家培训

RLVR$^{2}$: Reinforcement Learning with Verifiable Rubric-based Ranking

RLVR$^{2}$:基于可验证评分标准的强化学习排名

STRIDER: Stepping-Enabled Multi-Gait Hierarchical 3D Loco-Manipulation Framework for Humanoid Robots

STRIDER:用于人形机器人的步进多步态分层3D机车操作框架

PINGU: Extending Air-Bearing Spacecraft Emulators with Open-Source Actuators and Learned Control for Contact-Rich Proximity Operations

PINGU:扩展带有开源执行器和学习控制的空气轴承航天器模拟器,实现接触密集的近距离操作

Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models

先听再推理:基于感知的测试时间强化学习,适用于大型音频语言模型

Spiking Neural Network Actor-Critic Proximal Policy Optimization Control for Autonomous UAV Navigation Through Constrained Openings in Civil Infrastructure and Buildings

Spiking Neural Network Actor-Critic 通过受限开口在民用基础设施和建筑物中实现自主无人机导航的近端策略优化控制

Which Constraints Are Missing? Ask the Verifier: Graded Rewards for Constraint-Following Music Generation

缺少哪些约束?问验证者:遵循约束的音乐生成的分级奖励

Statistical Convergence of Transformer Encoder-Accelerated Robust Reinforcement Learning

变压器编码器加速强化强化学习的统计收敛

PackLab: A Comprehensive Framework for Developing, Training, and Evaluating MLLMs in Robotic Bin Packing

PackLab:一个用于开发、培训和评估机器人垃圾桶装卸MLM的综合框架

FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

FLARE:通过生成奖励模型实现长视野编码代理的全生命周期密集监督范式

VISTA: An Attention-Based Multi-Agent Reinforcement Learning Architecture for Space Situational Awareness Sensor Tasking

VISTA:基于注意力的多智能体强化学习架构,用于空间态势感知传感器任务

BarrierFormer: Transformer-Guided Predictive Barrier Enforcement for Safe Robot Control

BarrierFormer:变压器引导预测性障碍执行,实现机器人安全控制

Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation

Opt2VLA:用于丰富接触的人形全身操控的原力感知视觉-语言-行动

Anticipatory Robot Goalkeeping via Monotone Optimal Stopping

通过单调最优停止实现的预判机器人守门

Synthesizing Reactive Character Behaviors for Continuous Games via Programmatic Policy Search

通过程序化策略搜索综合反应性角色行为以实现连续游戏

Imagine-RL: Residual-Confidence-Guided Cross-Attention for World-Model-Augmented VLA Reinforcement Learning

Imagine-RL:残余信心引导交叉注意力,用于世界模型增强的VLA强化学习

Monitorable Chart Reasoning Agents via Verifiable Process Rewards

可监控的图表推理代理通过可验证的过程奖励

Dexterous Robot Manipulation from Human Demonstrations via Contact-Anchored Retargeting and Residual Policy Learning

通过接触锚定重定向和残余策略学习,从人类演示中实现灵巧的机器人操作

Reinforcement Learning under State and Outcome Uncertainty: A Foundational Distributional Perspective

状态与结果不确定性下的强化学习:基础分布视角

Luck Is Not Skill: When Do Paired Rollouts Help Group-Relative RL of LLM Agents?

运气不是技能:配对推广何时能帮助LLM代理的群体相对强化学习?

Acceptance-Aware Draft Model Training for Speculative Decoding

投机性解码的接受感知草稿模型训练

ChartJudgeBench: Evaluating LMM Judges for Chart-to-Code Generation

ChartJudgeBench:评估LMM法官以生成图表到代码

Audio-based UAV Localization with Adaptive Temporal Correspondence via Reinforcement Learning

基于音频的无人机定位,通过强化学习实现自适应时间对应

Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement

驯服VLM中CoT混淆:从机制证据到激活强制

Reinforcement Learning Inspired Black-box Adversarial Attacks for Computer Vision

强化学习启发了计算机视觉的黑箱对抗攻击

TTSE: A Two-Track Online Self-Evolution Framework

TTSE:双轨在线自我进化框架

Performance-Preserving Online Adaptation in Social Navigation via Diffusion Steering

通过扩散引导实现社交导航中保持性能的在线适配

Conduit: An Experience Data Plane for Distributed Reinforcement Learning

导管:分布式强化学习的体验数据平面

Fathom-Vaidya: Advancing Medical Reasoning with Rubric-Based Rewards

法通-维迪亚:基于评分标准的奖励推进医学推理

Lifted Bellman Linear Programming for Offline Reinforcement Learning

离线强化学习的提升贝尔曼线性规划

InsertAnything: Generalizable Contact-Rich Precision Insertion from Simulation to Reality

InsertAnything:从模拟到现实的可推广丰富接触精度插入

ME-VLM:A Unified VLM for Embodied Cognition and Agent Coordination

ME-VLM:一个用于具身认知与代理协调的统一VLM

Smoothness as a Constraint for Stable Humanoid Locomotion

平滑性作为稳定人形运动的约束条件

Offline Reinforcement Learning for Distribution-Grid Protection

配电网保护的离线强化学习

Steerable and Reactive Grasping Through Modular Design with a Three-Point Interface

通过模块化设计实现可转向和反应式抓取,采用三点接口

VideoGen-Agent: Reinforcing Video Generation Agents

VideoGen-Agent:强化视频生成代理

Keyword: diffusion policy

Latent Policy Steering: An Efficient and Flexible Framework for Cross-Embodiment Transfer

潜在政策引导:一个高效且灵活的跨身体转移框架

BEACON: Belief-Enabled Adaptive CONtrol for Imitation Learning under Uncertainty

信标:信念驱动的自适应控制系统,用于在不确定性下的模仿学习

Whole-Body UMI: Transferring UMI Manipulation Skills to Humanoid Whole-Body Manipulation via Real-Time Motion Generation

全身UMI:通过实时动作生成将UMI操作技能转移到人形全身操控

ContactDP: Contact-Guided Diffusion Policy for Tight Insertion Tasks

ContactDP:针对紧密插入任务的接触引导扩散政策

Performance-Preserving Online Adaptation in Social Navigation via Diffusion Steering

通过扩散引导实现社交导航中保持性能的在线适配

TACIT: Tactile Contact Supervision for Spatial Attention in Dexterous Manipulation

默契:灵巧操作中空间注意力的触觉接触监督

Touch2Robot: Robot Touch in the Human Demonstration Loop

Touch2Robot:人体演示环路中的机器人触摸

PredActor: Predictive Action Diffusion for Steerable Onboard Humanoid Control

PredActor:可转向人形控制的预测行动扩散