生成时间: 2026-08-17 16:43:58 (UTC+8); Arxiv 发布时间: 2026-08-17 20:00 EDT (2026-08-18 08:00 UTC+8)

今天共有 20 篇相关文章

Keyword: reinforcement learning

Reward Machines for Signal Temporal Logic

信号时间逻辑的奖励机

PROVE: Training-Free Prompt Recovery using Verifiable Evidence

PROVE:利用可验证证据实现无需培训的即时恢复

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

GRPO 超越英语:非英语及多语环境中GRPO的大规模研究

AdsWorldEngine: A Self-Evolving Conversational Advertising Agent through Orchestrator and Tool Coevolution

AdsWorldEngine:通过编排器和工具共进化实现自我演进的对话式广告代理

Bootstrapping Niche Multilingual Code Translation via Reinforcement Learning with Execution-Based Verifiable Supervision

通过基于执行的可验证监督强化学习,自助化细分多语言代码翻译

Knowledge-Data-Dual-Driven Reinforcement Learning for Autonomous Vehicle Control in Mixed Traffic

知识-数据-双驱动强化学习用于混合交通中的自动驾驶车辆控制

XAI-Guided Conservative Decentralized Execution for Offline Multi-Agent Network Slicing

XAI引导的保守式去中心化执行,用于离线多智能体网络切片

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:通过强化学习实现多模态大型语言模型推理的动态优化

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

基于图的强化学习框架,用于自主大型语言模型代理的结构化漂移诊断与恢复

Learning to Run Power Networks: Effective AlphaZero-inspired Topological Control

学习运行电力网络:受AlphaZero启发的有效拓扑控制

Reinforcement Learning-Based Production Scheduling in an Industry-Based Coating Scenario Using the Digital Model Playground

基于强化学习的生产调度在基于行业的涂层场景中,利用数字模型游乐场

AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning

AgilePE:通过自我游戏强化学习实现自主无人机追击-规避

Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine

消除时间音符冗余提升医学多模态强化学习

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:专家基础评分标准的自适应后培训

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

MathForm:利用知识检索和验证引导的精炼来扩展数学自形式化

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:Agent RL 的边疆优化奖励-接地环境综合

CORAL: Curriculum-Optimized Reward Adaptation for LiDAR-Based Goal-Directed Urban Driving

CORAL:基于激光雷达的目标导向城市驾驶的课程优化奖励适应

CoRun: Padding is Simple and Efficient for Deterministic LLM Inference

CoRun:填充简单高效,用于确定性大型语言模型推断

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一路径-空间视图

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:视觉语言模型训练后的跨阶段GPU空间共享

Keyword: diffusion policy

There is no result