生成时间: 2026-09-01 21:14:04 (UTC+8); Arxiv 发布时间: 2026-09-01 20:00 EDT (2026-09-02 08:00 UTC+8)

今天共有 73 篇相关文章

Keyword: reinforcement learning

CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis

CDPR:基于成本的反事实优势信用分配,用于成本意识的顺序医疗诊断

SHAPE of Chain-of-Thought in Math Reasoning

数学推理中思维链的形状

InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal

InternReviewer 与 InternAdvocate:同伴评审与反驳中能动强化学习的客观奖励与评估

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

未知物理环境中地面机器人的认知基础设备运行时学习

ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

ERR+:连续熵解析,实现高效且果断的大型语言模型推理

Efficient Geothermal Well-Control Optimization via Diffusion-Surrogate Reinforcement Learning

通过扩散-替代强化学习实现高效的地热井控制优化

Designing, Deployment and Field Testing of C2Stack for Networked Intelligent Software-Defined UAVs

C2Stack 的网络智能软件定义无人机设计、部署及现场测试

The Halt Vector: Internalizing a Causal Steering Intervention for Efficient Reasoning

停机向量:内化因果引导干预以实现高效推理

Hybrid Offline-Online Multi-Agent Decision Transformers for Wireless Resource Management

用于无线资源管理的混合离线-在线多代理决策变换器

Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI

CVaR-UCBVI的无连续性近极大领先阶遗憾

The Role of Network Topology and Opponent Information in Shaping Cooperation in Multi-Agent Reinforcement Learning Systems

网络拓扑和对手信息在塑造多智能体强化学习系统合作中的作用

Teaching Robot Policies to Humans Using Erroneous Examples

用错误例子教导人类机器人政策

Learning to Follow In-Context Watermark Instructions via Self-Distillation

通过自我蒸馏学习遵循上下文中的水印说明

PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning

PathBridger:离线目标条件强化学习的子目标桥梁

Titans-QFWP: A Regime-Aware Hybrid Quantum Fast Weight Programmer for Portfolio Optimization

Titans-QFWP:一款用于投资组合优化的区域感知混合量子快速权重编程器

Beyond Correctness: Validity-Oriented Evaluation of Biomedical LLM Judges

超越正确性:生物医学LLM评审的效度导向评估

Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space

入口处锁着,内部敞开:RLVR缩小了解答空间

A-MADiff: Attention-Guided Multi-Agent DRL with Diffusion Policies for Memory-Aware Task Orchestration in Mobile AIGC Networks

A-MADiff:带有扩散策略的注意力引导多智能体日程学习,用于移动AIGC网络中的内存感知任务编排

RACER: Reinforced Agent Collaboration for Explainable Reasoning on Knowledge Graphs

RACER:强化智能体协作,用于知识图谱的可解释推理

RAGDiffusion++: From Macro-Retrieval to Micro-Fidelity Alignment for Garment Generation

RAGDiffusion++:从宏检索到服装生成的微保真对齐

When Do Larger Batches Help Scale LLM Reinforcement Learning?

什么时候,更大批量的学习有助于扩大LLM强化学习?

Plant-Inspired AI: Plants as Inspiration for Novel Problem Formulations, and Two Case Studies

植物启发的人工智能:植物作为新颖问题表述的灵感,以及两个案例研究

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步进-DPO实现小型多模态搜索剂

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修订:多层次营销中对不一致性感知的视觉自我修正

Personalized Recommender Systems for Gym Workouts: A Reinforcement Learning Approach

个性化健身房锻炼推荐系统:强化学习方法

RL-based Network Slice Embedding over Space Division Multiplexed Elastic Optical Networks

基于强化学习的网络片嵌入空间分割复用弹性光网络

Reference-Grafting Matches Fine-Tuning at Eliciting Sandbagged Capabilities

参考嫁接与精细调谐匹配,诱导沙包能力

A Causal Model for Locating and Unlocking Sandbagging in Model Organisms

定位和解锁模式生物中沙袋的因果模型

FuncRoom-Agent: Sequential Feed-Forward 3D Functional Indoor Scene Generation

FuncRoom-Agent:顺序前馈3D功能室内场景生成

Beyond Surface Alignment: Grounding the Dynamics of Situational Understanding and Generative Control in LLMs

超越表面对齐:奠定大型语言模型中情境理解与生成控制动态的基础

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:刑事判决预测中结构化法律推理的法理政策优化

AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

AgenticRag-R1:基于栈内存的代理强化学习,用于多步推理、检索和记忆

Harness-RL: Black-Box Reinforcement Learning with Action-Args Decoupling for Central-Agent Multi-Agent Harnesses

束带-RL:基于动作-Args解耦的黑匣强化学习,适用于中央代理多智能体束

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL:异步执行中的在线强化学习

Beyond Global Realism: Virtual Try-On Evaluation and Optimization with Dimension-wise Garment Fidelity Assessment

超越全球真实性:虚拟试穿评估与优化,采用按尺寸进行服装真实度评估

SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation

SymVD:机器人操作的对称视觉语言动作提炼

A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

A^2Agent:基于仓库级代码本地化代理的动作感知强化学习

GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

GenRubric:用于可扩展LLM评估的自我演进评分标准生成

Uncertainty-Driven Replay Memory for Reinforcement Learning

不确定性驱动的回放记忆用于强化学习

When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents

当历史多模态时:重新思考长期视野代理的上下文管理

SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking

SearchWiki:学习构建和导航知识维基以促进主动信息寻求

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

TEMPO:大型音频语言模型的时序基础多任务后期训练

Small Language Models as Judges for Rubric-Based Reinforcement Learning

小语言模型作为基于评分标准的强化学习评判

COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning

COGTRL:通过强化学习,利用认知痕迹训练大型语言模型进行科学发现协助

Online Estimation of Dynamic Origin-Destination Matrices Using Reinforcement Learning with Link-Flow Propagation Guidance

利用强化学习结合链路流传播指导的动态起点-目的矩阵在线估计

Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

超越极化:点数重排序中思维链的生成约束

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐可解释的外地 POI 顺序生成的 LLM 语义推理

Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

本地引导的演员-批评者:用具备子目标意识的批评者训练目标条件演员

Confounding Masquerading as Improvement: A Systematic Evaluation of Offline Reinforcement Learning for Stroke Antithrombotic Treatment in a 129,000-Patient Registry

混淆伪装为改善:系统评估129,000名患者登记中中风抗血栓治疗的离线强化学习

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

学习结果变化之处:多模几何的学分可定论推理

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:多任务强化学习的进步增强优势课程

DiffPDE: Masked Diffusion Language Models as PDE Solver

DiffPDE:掩盖扩散语言模型作为偏微分方程求解器

SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

SPHERE:通过音频语言模型的自动音乐上混,后期训练与空间启发式奖励

Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

学习合成时空视频基础教学

GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

GMTS:基于梯度幅度的令牌选择提升了 LLM 推理的 RLVR 训练

Test-time Reinforcement Learning in Imperfect Information Games

不完全信息博弈中的测试时强化学习

Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL

一次三步:对比强化学习中的动作序列表征

HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving

HiRS-Agent:一个用于可靠远程遥感任务解决的分层多智能体系统

CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments

CIG-RL:在不确定环境中进行源词估计的好奇心驱动信息引导强化学习

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:多模大型语言模型的单次可解释视觉搜索

Learning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval

从你所检索的内容中学习:在线强化学习语义检索的微调

T3S: Improving Multi-Task Reinforcement Learning with Task-Specific Feature Selector and Scheduler

T3S:通过任务专属功能选择器和调度器提升多任务强化学习

S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation

S3C-LLM:用于谱到结构阐明的技能代码引导代理语言模型

Beacon: LLM Multi-Agent Driven Hardware Design Space Exploration for Heterogeneous Multi-Chiplet Deep Learning Accelerators

信标:多智能体驱动硬件设计空间探索,面向异构多芯片深度学习加速器

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0:引发VLM空间智能以实现通用具身导航

One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

一个策略就足够:单智能体强化学习在化学工具学习中优于树状搜索

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于预测变量的强化学习何时与人类感知相匹配?基于编码器的语音语言模型中主观奖励的研究

Normalized Low-Rank Adaptation

归一化低阶适应

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

政策提炼真的能提炼吗?从吵闹的老师到自我提升

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督的大规模推理模型扩展:迈向超级智能之路

Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization

在代理性政策优化中调和流程监督与基于结果的信用

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:2K分辨率下实现原生音视频生成的民主化

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的进化研究计划生成

Keyword: diffusion policy

There is no result