生成时间: 2026-08-05 18:39:00 (UTC+8); Arxiv 发布时间: 2026-08-05 20:00 EDT (2026-08-06 08:00 UTC+8)

今天共有 50 篇相关文章

Keyword: reinforcement learning

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

别再生,调试:一个专门用于修复近失控硬件操作员的领域专用代理

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

通过演进评分标准的强化学习作为音频推理的奖励

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型会不会扩展并发现异构推理?

FLARE: Few-shot Learning-based Adaptive Reflective Engine

FLARE:基于少数样本学习的自适应反射引擎

Rubrics as Privileged Information for Open-Ended Generation

评分标准作为开放式生成的特权信息

SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

SP3O:无奖励建模的分段偏好强化学习

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

ValueFormer:一种因果变换器价值函数,带有阶段感知标签,用于半自治视觉-语言-行动策略

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

基于增量知识的神经符号推理,用于样本高效层级强化学习

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:一种用于上下文感知时间序列预测的快速-慢-反射代理推理框架

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

LLM 在野外服务:框架、方法与系统设计的实证研究

PLAN: Parallel Liquid-Inspired Approximation Network for Efficient Representation Learning in Flexible Job Shop Scheduling

计划:并行液体启发近似网络,用于灵活工坊排班中的高效表示学习

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:将长上下文推理推送到360万个并行迭代存储的token中

Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

迈向更具表现力的口语大型语言模型:细粒度意图基准与声学-词汇解耦策略优化

CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

CVPO:通过价值方差适应和动态课程学习提升LLM强化学习推理能力

PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

PAMT:多域机器翻译的过程对齐强化学习

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

SMOPD:通过专精合并在线政策提炼实现的多奖励强化学习

Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL

凸包-邻域光滑对偶推广:在离线强化学习中控制局部修正传播

Shooting for Contact: Contact-Implicit Multiple Shooting for Dynamic Motion Retargeting

接触射击:动态运动重定向的接触隐式多重射击

Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

别偷看答案:无标签RLVR的Outcome-Masked Group 相对策略优化

Process-Knowledge-Embedded Safe DRL for Real-Time Dispatch of Process Loads in Industrial Microgrids

工业微电网中工艺知识嵌入式安全日程学习,用于实时调度工艺负载

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对比大型视觉语言模型:轨迹引导结构化采样方法

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

带有自我提炼奖励塑造的能动强化学习

PFM-HR: Pose Flow Matching for Humanoid Robots

PFM-HR:人形机器人姿态流匹配

TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series

TimeRLM:递归语言模型实现了长上下文时间序列中的精确异常定位

Hierarchical Constrained Reinforcement Learning with Dynamic Boundary for Spatio-Temporal Vehicle-to-Grid Scheduling

具有动态边界的层级约束强化学习用于时空车辆到网格调度

When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO

当正确解决方案重复出现:GRPO稀有度感知信用再分配

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定的轨迹提升到功能层面的图表中,实现可通用的工具规划

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

继续还是重新规划?伯努利-延续策略学习:自适应视界执行

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

混合大型语言模型增强强化学习代理用于复杂顺序决策任务

Training Documents Reranker with Search Rubrics for Deep Research Agent

深度研究代理的培训文档重排序工具及搜索评分标准

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

Hi-TTRL:调控共识并提供测试时强化学习的提示

Robust General Utility for Reinforcement Learning

强化学习的强健通用实用性

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

SFT冲突,强化学习共存:大型语言模型多任务学习的理论与实证分析

Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

多语言语言模型ASR的多教师政策提炼

Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details

种子间交叉对战足够吗?评估零次协调算法与实现细节的稳健性

Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

群体视角的重要性:规范辩论关系可以缓解多代理辩论中的盲目从众

CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning

因果OPD:提炼因果链推理的首次错误监督

DiagLoop: A Counterfactual Data Flywheel with Stage-Localized Reinforcement for Diagnostic LLMs

DiagLoop:一个带有阶段局部强化的反事实数据飞轮,用于诊断大型语言模型

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

PhyAI:边缘的实时物理AI,云端可扩展部署

GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation

戈登:基于图的以对象为中心的长视野操作分解奖励

AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding

AgenticVAU:多智能体探索-验证视频异常理解的推理

History Matters: Meta-policy Delegation with Heterogeneous Multi-agent Reinforcement Learning

历史重要:采用异构多智能体强化学习的元策略委派

FedCritic-MIMO: Communication-Efficient Serverless Federated Critic Learning for Massive-MIMO Resource Control in Open and Disaggregated 6G RANs

FedCritic-MIMO:用于开放和拆分6G RAN中大规模MIMO资源控制的通信高效无服务器联邦批评者学习

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:自我演进的奖励与流量匹配策略优化,实现稳健的人机在环强化学习

Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning

通过结构感知微调增强VLM奖励模型

Latent Reward Registers for Diffusion Preference Alignment

扩散偏好对齐的潜在奖励寄存器

Stochastic Multiple Shooting Trajectory Optimization via Sequential Local Policy Evaluation

通过顺序局部策略评估实现随机多重射击轨迹优化

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:工具整合推理的转向层次回顾自我提炼

Keyword: diffusion policy

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

针对需要时间变化力的操作任务的层级模仿学习方法

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB 预算内的双手操作:入门级 Jetson 上的零拷贝感应与量化 ACT