生成时间: 2026-07-29 18:41:44 (UTC+8); Arxiv 发布时间: 2026-07-29 20:00 EDT (2026-07-30 08:00 UTC+8)

今天共有 28 篇相关文章

Keyword: reinforcement learning

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:自适应在线广告的层级政策内竞标代理

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

下一集:通过视觉语言模型进行推理驱动的视频推荐

AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning

AdaKP:在线自适应知识点选择,用于推理导向强化学习

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:用可扩展的合成和验证任务训练长视野搜索代理

Egocentric Station Holding of Robotic Fish in Unknown Turbulent Background Flow

在未知湍流背景流中自我中心的机械鱼站停留

Inverse RL Helps Align AI by Imitating Humans

逆强化学习通过模仿人类来帮助对齐人工智能

Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning

校准部分重置:防止持续强化学习中的策略崩溃

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

类似模型学习方式不同:最终窗口预训练形状 超越SFT训练后

PLATO: Pointer Learner for Agent and Task Openness

柏拉图:代理与任务开放性的指针学习器

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向小尺度语言模型代理的稳健强化学习

Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning

端点重放:深度强化学习中的最新缓冲区压缩

A Unified Algorithmic Framework for Hybrid Reinforcement Learning in Tabular MDPs with Shifted Transition Dynamics

一个适用于具有转移动态变化的表格MDP中的混合强化学习的统一算法框架

Structure-aware Relative Policy Optimization for Ranking

结构感知的相对策略优化以实现排名

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

演员阵容:游戏解决者作为LLM代理的回合级教师

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一个控制系统、一个数据集,以及一个让冻结的大型语言模型代理学习域的配方

Bayesian-Guided Cooperative RL Beamforming for Wireless Adversarial User Detection

贝叶斯引导的合作式强焰学习波束成形用于无线对抗用户检测

System-Aware Adaptive CSI Feedback via RL-Guided Autoencoder Switching in Multi-User MIMO System

通过多用户MIMO系统中的RL引导自编码器切换实现系统感知自适应CSI反馈

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

CoRT:用于令牌级评分标准引导策略优化的反事实重放

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

通过系统多智能体深度强化学习实现复杂环境中的协作式多无人机导航

A Hierarchical Optimisation Framework for Integrated Electric-Hydrogen-Transport Systems

集成电力-氢气运输系统的层级优化框架

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

推理时投机:教代理通过联合代理-投机者强化学习预测下一个工具调用

WarmTuner: Program-Specific Warm Starts for Compiler Autotuning via Offline-to-Online Reinforcement Learning

WarmTuner:通过离线到在线强化学习实现编译器自动调优的程序专属热启动

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

RecoReward:推荐者引导的多模态描述生成

Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

交互式奖励代理:通过环境状态验证进行图形用户界面任务评估

Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics

基于执行器动力学的物理感知端到端深度强化学习,用于四旋翼控制

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习多工具视觉推理以实现超高分辨率遥感

Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

重新知情的梦想者:通过潜在指导高效训练的非对称世界模型

Keyword: diffusion policy

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习