生成时间: 2026-09-14 22:49:09 (UTC+8); Arxiv 发布时间: 2026-09-14 20:00 EDT (2026-09-15 08:00 UTC+8)

今天共有 33 篇相关文章

Keyword: reinforcement learning

Performance, Efficiency and Collapse -- Advantages and Challenges in Offline Post-training of Code LLMs

性能、效率与崩溃——代码大型语言模型离线后训练中的优势与挑战

Certified Safety Curation: Distribution-Free Guarantees for Safe Offline Reinforcement Learning

认证安全策展:安全离线强化学习的无分发保证

Inverting Self-Triggered Control: Adversarial Reinforcement Learning for Sparse Denial-of-Service Attacks

逆转自我触发控制:针对稀疏拒绝服务攻击的对抗强化学习

Reinforcement Learning for Syndrome Extraction

综合征提取的强化学习

Repair Before Reinforce: Context-Augmented Knowledge Graph Reasoning for Multi-Hop Question Answering

修复后强化:多跳问答中的上下文增强知识图谱推理

DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

DIA:扩散策略优化的去噪中间优势

Adaptive Chemotherapy Control under Tumor Heterogeneity via Reinforcement Learning

通过强化学习实现肿瘤异质性下的适应性化疗控制

Reinforcement Learning over Patient Trajectories for Clinical Reasoning in EHR Foundation Models

EHR基础模型中对患者轨迹的强化学习,用于临床推理

Sampling via Decision-Flow: Training-Free Extraction of Improved Latent Reasoning Paths in Large Language Models

通过决策流抽样:大型语言模型中改进的无训练潜在推理路径提取

BlueLM-GUI Technical Report: A Real-Device-Centric Flywheel for Self-Improving Mobile GUI Agents

BlueLM-GUI技术报告:一个以真实设备为中心的移动图形界面代理的飞轮

VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets

VRL-Bench:在有限试验预算下对计算机控制任务进行基准测试

MInTRL: Off-policy Intervention can boost On-policy RL

MInTRL:非政策干预可以提升非政策强化学习

Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

长视野LLM代理强化学习的粒度自适应学分赋值

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

EvoRS:开放式强化学习中奖励系统的政策自我演化

AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization

AMDKernelVault:AMD GPU内核优化的大规模数据集与代理训练

LettuceVisSim: A Simulator That Generates Lettuce Image Time-series for Vision-Based Reinforcement Learning

LettuceVisSim:一款生成生菜图像时间序列的模拟器,用于基于视觉的强化学习

From Collaboration to Capability: Internalizing Routed LLM Experts into Compact Reasoners

从协作到能力:将被引导的大型语言模型专家内化为紧凑的推理工具

Direct Preference Density Alignment for Conversational Audio Equalization

会话音频均衡的直接偏好密度对齐

SteerDuplex: Steerable Duplex Speech Dialogue Models

SteerDuplex:可导向双工语音对话模型

Distortion of AI Alignment Revisited: RLHF is a Decent Utilitarian Aligner

AI阵营扭曲再审:RLHF是一款不错的实用对齐器

Size Doesn't Matter: Material-State Reinforcement Learning for Excavator Transferable Soil Manipulation

尺寸无关紧要:挖掘机可转移土壤操作的材料状态加固学习

Personalized and Trust-Aware Health Recommendation Policies for a Construction Workplace

建筑工作场所个性化且信任意识的健康建议政策

SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy

SCQ:用S形有界熵稳定保守Q-学习

Curriculum-Based Adversarial Heterogeneous Agent Reinforcement Learning for Autonomous Quad-Copter Landing in Maritime Settings

基于课程的对抗异构代理强化学习,用于海上环境中自主四旋翼着陆

Offline Reinforcement Learning for Wind Farm Control: A Wind Tunnel Study under Dynamic Wind Directions

风电场控制的离线强化学习:动态风向下的风洞研究

Groupoid-Based Internal State Representations for Reinforcement Learning with Local Symmetries

基于群的内部状态表示,用于带有局部对称性的强化学习

Robust Policy Optimization via Adversarial Importance Sampling

通过对抗重要性抽样实现稳健策略优化

MCRL2: Multi-resource Cross-attention-based Representation Learning-augmented Reinforcement Learning for Cloud Microservice Scheduling

MCRL2:基于多资源的跨注意力表征学习增强强化学习,用于云微服务调度

A Unified and Constrained View of Regularization-Based Robust Reinforcement Learning

基于正则化的强健强化学习的统一与约束视角

Expert-Space Exploration in MoE Reinforcement Learning

专家-太空探索在工程部强化学习中的应用

CanvasAnneal: Curriculum Reinforcement Learning for Diffusion Language Models

CanvasAnneal:扩散语言模型的课程强化学习

Keyword: diffusion policy

RodForesight: A World Model Enhanced Diffusion Policy for Slender and Material Agnostic Rod Insertion

RodForesight:一种世界模型增强扩散政策,适用于细长且无材质的杆状插入

Online Material Estimation for Conditioned Diffusion Policy in Shaping Deformable Linear Objects

在塑造可变形线性物体中的条件扩散政策在线材料估计