生成时间: 2026-08-11 17:00:26 (UTC+8); Arxiv 发布时间: 2026-08-11 20:00 EDT (2026-08-12 08:00 UTC+8)

今天共有 58 篇相关文章

Keyword: reinforcement learning

Unified Hallucination Fuzzing for Multimodal Large Language Models

多模态大型语言模型的统一幻觉模糊

DocAtlas: Long-Document Understanding as Mutable-State Interaction

DocAtlas:作为可变状态交互的长文档理解

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:通过基于表示的内在奖励实现基于基础的搜索代理

Generalizing deep reinforcement learning across cable-driven parallel robot configurations with actuator-level policies

将深度强化学习推广到具有执行器级策略的电缆驱动并行机器人配置

Learning an Interior Layout Policy in a Domain Specific Language Action Space

在领域特定语言动作空间中学习内部布局策略

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

接下来要编辑什么:对话系统中的视觉对齐图像编辑后续建议

Multi-Branch Policy Optimization for Multimodal Large Language Models

多模态大型语言模型的多分支策略优化

CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning

CODS:可复用离线强化学习的迭代贝尔曼残差数据选择

LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation

《清醒:通过想象动力学实现潜在技能统一控制,实现远景类人机车操控》

The Sample Complexity of Policy Learning with Mu-Resets

采用多重重置的策略学习示例复杂性

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

V-Simba:释放强化学习在视觉连续控制中的架构潜力

Distilling Physical Priors into Streaming World Models

将物理先验提炼成流世界模型

Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models

基于时间序列基础模型训练后强化学习的地面真实邻域正则化

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

强化学习中动态奖励塑造的统一框架

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:视频异常检测的可视化工具编排

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德代理的元规范理论

Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

控制多样性强化微调:解耦强化学习后共享控制瓶颈

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

从环境反馈中学习:跨多时间尺度的代理强化学习学分分配

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:高效且结构化的过程奖励,用于自我纠正多模态推理

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:多范式机器人奖励模型的偏好排序等张评分编辑

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

结构化参数环境下的课程生成,以实现稳健的导航政策

Knowledge-Distilled End-to-End Reinforcement Learning for Smooth 6-DOF Thrust Control and Rapid Adaptation to Ocean Currents in Remotely Operated Vehicles

知识蒸馏的端到端强化学习,实现平滑的6自由度推力控制及对洋流的快速适应,适用于遥控飞行器

Multi-Agent Reinforcement Learning via Agent-Specific Preference

通过智能体特定偏好进行多智能体强化学习

MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning

MedCalc-R1:医学数学推理的知识引导奖励框架

Trajectory Design and Budgeted Querying for Digital Twin Calibration

轨迹设计与数字孪生校准的预算查询

Catastrophic Forgetting in Continual Reinforcement Learning

持续强化学习中的灾难性遗忘

Improving Generalization Robustness of Multimodal RLVR

提升多模RLVR的泛化鲁棒性

ML-Based Hierarchical Prediction for Practical Energy Scheduling in Dynamic NTN-WPT Systems

基于机器学习的层级预测,用于动态NTN-WPT系统中实际的能源调度

Hierarchical Topology-Aware Planning and Control of Underwater Vehicle-Manipulator Systems in Confined Environments

在受限环境中对水下载具-机械臂系统的层级拓扑感知规划与控制

DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference

DistillCache:KL引导自适应KV-缓存驱逐,实现内存高效LLM推断

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

主观任务的大型语言模型推理:失效模式、缓解措施与动态推理路由

Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

阅读不是推理:弥合视觉-文本压缩中的能动政策鸿沟

Motif 3: Technical Report

主题三:技术报告

RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

RISE-RL:基于评分标准的开放式强化学习选择性探索

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning

SpeedTuning:用轻量级强化学习加速策略执行

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

CodecArena:通过视觉强化学习进行编码器质量评估

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

一种用于结直肠癌治疗计划的代理生成大型语言模型

How Roadside Units Enhance Intersection Safety? Cooperative Autonomous Driving System Design and A Proof of Concept

路边单元如何提升路口安全?协作自动驾驶系统设计与概念验证

SparsePilot: Belief-Guided Network Planning under Sparse Wireless Measurements

SparsePilot:基于稀疏无线测量的信念引导网络规划

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解决性:任务可学习性作为LLM RL培训后静态先验

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:流匹配模型的退化参考推断策略蒸馏

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

通过强化学习实现任务导向编队决策:驱赶攻击群体

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

SoftmaxGRPO:学习使用 Softmax 优势群估计推理

CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

CoRE:通过均衡共识奖励测试时间强化学习

Control-Oriented Scenario Tree Construction through Reinforcement Learning

通过强化学习构建控制型情景树

Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation

意图更响亮:可控用户模拟超越响应模仿

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

ZetaGPT:定位--编码-自由状态-空间-注意力语言模型的参考实现

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

聆听、观察与跟踪:全模态语言模型的时空视听事件推理

Learning to Modulate, Not to Cycle: Soft Actor---Critic Recovers Inverter-Style Heat-Pump Control

学习调节,而非循环:软演员---评论家恢复逆变器式热泵控制

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:一种针对空中视觉语言导航的失败感知强化后学习框架

Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning

通过言语强化学习实现大型语言模型个性化的学习偏好调整

Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

双向上下文自我蒸馏用于基于技能的大型语言模型代理的强化学习

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

AudioMap:针对时间感知密集音频字幕的闭门选择强化学习

Bayesian Symbolic Regression with Entropic Reinforcement Learning

贝叶斯符号回归与熵强化学习

SR-OPSD: Self-Referenced On-Policy Self-Distillation

SR-OPSD:自指政策自我提炼

Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

通过集中训练和批判分解,实现机器人操作的高效现实世界在线强化学习

Parameter Exploration for RLVR via Variational Learning

通过变分学习进行RLVR参数探索

Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation

将技能提炼为权重,而非提示:抽象技能作为策略性自我提炼的特权信号

Keyword: diffusion policy

There is no result