生成时间: 2026-09-02 20:38:06 (UTC+8); Arxiv 发布时间: 2026-09-02 20:00 EDT (2026-09-03 08:00 UTC+8)

今天共有 41 篇相关文章

Keyword: reinforcement learning

Elite-Weighted Supervised Fine-tuning for Goal-Directed Molecular Optimization

精英加权监督微调以实现目标导向分子优化

AI Should Not Only Be Helpful. It Should Be Contingent. Artificial Intimacy, Sycophancy, and the Future of Social Learning

人工智能不仅应该是有帮助的。它应该是偶然性的。人工亲密、谄媚与社会学习的未来

Uncovering and Mitigating Aggregation-Induced Reward Hacking in Multi-Reward Reinforcement Learning

发现并缓解多奖励强化学习中由聚合诱导的奖励黑客行为

WiSDoM: Wireless Sparse Decision Transformer with Mixture-of-Experts for Multi-Task Mobile Network Optimization

WiSDoM:配备专家混合的无线稀疏决策变换器,用于多任务移动网络优化

StreamScout: Learning When to Look Deeper for Streaming Video Understanding

StreamScout:学习何时深入寻找流媒体视频理解

Risk-Aware Decision-Making for Autonomous Overtaking: A World Model-Based Mixture-of-Experts Framework

自主超车的风险感知决策:基于全球模型的专家混合框架

DRLM: Deep Reinforcement Learning-Based LLM Query Orchestration in Edge Environments

DRLM:基于深度强化学习的边缘环境中的LLM查询编排

Group Adaptive Clipping Policy Optimization

群自适应裁剪策略优化

Can LLMs Use Relational Transformer Embeddings?

LLMs 可以使用关系型变换器嵌入吗?

GlitchLab: A Hardware-in-the-Loop Optimizer for Physical Fault Injection

GlitchLab:物理故障注入的硬件在环优化器

GeoPAR: Large-Scale Multi-Agent Combinatorial Optimization with Geometry-Guided Parallel Autoregressive Learning

GeoPAR:基于几何引导并行自回归学习的大规模多智能体组合优化

It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

需要两个人才能匹配:共同进化的生成式寻回犬与强化学习

ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control

ADAPT:敏捷扩散行动先验,实现稳健且可引导的在线文本驱动人形控制

Online Self-Weighted Fine-Tuning

在线自加权微调

Non-Prehensile Throwing: A Reinforcement Learning Perspective

非抓握投掷:强化学习视角

Instella-MoE Technical Report

Instella-MoE 技术报告

SFAD: Speculative Factuality-Aware Decoding

SFAD:推测事实感知解码

One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

一项政策,任何预算:通过强化学习内化预算感知搜索

Dense Process Supervision for Search Agents via Fact Utility Estimation

通过事实效用估计实现搜索代理的密集过程监督

Reinforcement Learning Enhanced LLM Agents for Complex Vehicle Routing Problems

强化学习增强型大型语言模型代理,用于复杂车辆路由问题

CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training

关怀:基于对比锚点的评分标准演化,适用于大型语言模型训练后

AInfer-PD: Communication-Safe In-Place Prefill-Decode Multiplexing for Distributed MoE Rollouts

AInfer-PD:分布式MoE部署的通信安全原位预填充-解码复用

ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

ARISE-RL:基于能动评分标准的迭代自我进化与强化学习

Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC

通过MPC求解器加速强化学习——权重变化MPC梯度指导

World Model-Guided Reinforcement Learning via Counterfactual User Engagement Simulation

通过反事实用户参与模拟实现的世界模型引导强化学习

Update for Decisions, Not Freshness: Goal-Oriented Status Updating and Selective Offloading at the Network Edge

更新为决策,而非新鲜度:目标导向状态更新和网络边缘的选择性卸载

PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance

PersuaRL:基于强化学习驱动的多专家选择,用于保险中说服性对话生成

CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

CaRL-EM:面向大型语言模型实体匹配的成本感知强化学习

Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents

探索更多,漂移少:仅结果强化学习足以满足长远视野互动代理的需求

From Base Rollouts to RL Reasoning: A Budgeted Search Perspective

从基地部署到强化学习推理:预算搜索视角

VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models

VerTox:基于神经排名模型的可验证奖励引导红细胞中毒

Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR

验证者失效之处:RLVR中奖励信号的类别级审计

EdiTikZ: Scientific Figure Editing from Revision Trajectories

EdiTikZ:从修订轨迹出发的科学人物编辑

Provably Safe Sim-to-Real Transfer

可验证的安全模拟到现实传输

NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games

NashDreamer:零和不完美信息游戏中的基于模型的强化学习

Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

通过熵进行选择性代理指导:从不完美的VLM教师那里学习自主策略

Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

从小型到大型大型语言模型(LLM)的近优SFT-RL注释预算分配扩展

StudentSim: Training LLM-based Student Simulators

StudentSim:训练基于LLM的学生模拟器

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

Facet-0:用于接触丰富精密操作的机器人基础模型

The Rise of Verbal Reinforcement Learning

言语强化学习的兴起

Keyword: diffusion policy

ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control

ADAPT:敏捷扩散行动先验,实现稳健且可引导的在线文本驱动人形控制