生成时间: 2026-07-31 18:41:19 (UTC+8); Arxiv 发布时间: 2026-07-31 20:00 EDT (2026-08-01 08:00 UTC+8)

今天共有 42 篇相关文章

Keyword: reinforcement learning

RLPF: Reinforcement Learning from Performance Feedback for Code Generation

RLPF:通过性能反馈进行代码生成的强化学习

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:通过学习盲点诊断实现LLM代理自我进化

Simulation of Surgical Suturing Using Position-Based Dynamics and the Material Point Method for Robot Reinforcement Learning

利用基于位置动力学和材料点方法进行手术缝合模拟,用于机器人强化学习

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自我监督语义扩散训练参数等技能

DeepResearch Agent System

DeepResearch 代理系统

Policy Gradient Steering: Interventions from Behavioral Objectives

政策梯度引导:行为目标干预

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼遇见课程:自适应强化学习的高效动态提示选择

Real-Time Hard Peak Age-of-Information Safety with No-Regret Learning

实时硬峰值信息时代安全与无悔学习

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:参考引导值校准与数学推理中的差异感知令牌重权

Harness-G: A Graph-Structured Harness for Search Agents

Harness-G:一种用于搜索代理的图结构工具

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:用于图像到SVG生成的视觉反馈驱动强化学习

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

Cocktail-Talker:在嘈杂社交环境中采用转动GRPO的多扬声器对话建模

Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold

超越最佳教师:扩展与压缩推理解流形

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

RedFlow:将失败重定向为动作级修正,以实现流量匹配的VLA策略

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

LoRA支架策略优化(LSPO):一个采样时间低秩支架,用于在零奖励悬崖提示上恢复强化学习梯度

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有代币都应获得同等的信用:反事实敏感性信用重新分配用于长期CoT推理

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就足够了:针对基于MLLM的场景文本发现优化的视觉令牌接地

Class-Aware Reinforcement Learning for Counterfactual Explanation Generation

反事实解释生成的类感知强化学习

Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

精确的动作值不足以实现:多区 VAV 控制推理模型的推理模型的推广验证增强微调

Learning Social Robot Navigation By Sensing Human Legs

通过感知人类腿部学习社交机器人导航

AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

AutoPref:自动发现神经组合优化中的任务特定偏好目标

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation

MARS-RA:通过多模态比较实现学分分配的排名聚合,实现具象多代理合作中的应用

Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning

超越二元奖励:强化去学习奖励设计的比较研究

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:LLM代理的过渡感知策略优化

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

通过特权自蒸馏进行对比强化策略优化

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索和插入验证图像接地

GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios

GVR-Coder:一个用于复杂文档和会议场景中结构化SVG生成的可视化反馈框架

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

群体反思自我蒸馏用于能动强化学习

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:大型语言模型中高效RLVR的潜在引导探索-利用提示采样

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART:通过市场对齐强化学习实现算法交易的金融情绪分析

LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning

LM-GRASP:通过在线模仿学习实现组合构建的实例特定语言模型

HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

HARGO:针对强化学习后训练的高效计算任务中,异质性感知奖励引导优化 LLMs

Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs

平均奖励CMDP中顺序最优神经演员-批评者的层级多层次蒙特卡洛

SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute

SVR:通过联合判决-置信度强化学习进行自适应测试时间计算的自我验证精炼

Cybersecurity Detection Classification with Reasoning-enabled Language Models

基于推理驱动的语言模型进行网络安全检测分类

Can Vision-Language Models Reason about AI Edits in Images?

视觉语言模型能否推理AI在图像中的编辑?

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:将导航扩散政策推广至新颖行为和具象,采用Q分数重加权匹配

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β$-OPSD:以策略优化为导向,以自我蒸馏训练

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

信标:了解何时以及如何进行代理视觉推理

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型实施标准化评估

Keyword: diffusion policy

DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection

DexDirect:直接动觉臂引导,高效灵巧示范采集

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

FA-RDP:一种用于丰富接触操作的频率自适应反应扩散策略