生成时间: 2026-08-07 17:01:08 (UTC+8); Arxiv 发布时间: 2026-08-07 20:00 EDT (2026-08-08 08:00 UTC+8)

今天共有 32 篇相关文章

Keyword: reinforcement learning

Teaching Intro AI When the Tools Can Do the Homework: A Course Redesign and a Student Bill of Rights

当工具能完成作业时教授入门人工智能:课程重设计与学生权利法案

Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning

Search2Skill:通过基于评分标准的强化学习超越知识边界的技能提炼

An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals

新兴的零售投资组合管理应用:个性化、税务意识强化学习,结合自然语言目标

Multi-Agent Transformer for Queue-Level XR Traffic Scheduling in TSN Networks

TSN网络中队列级XR流量调度的多代理变换器

Multi-Agent Reinforcement Learning for Online Traffic Scheduling in Time-Sensitive Application

多智能体强化学习用于时间敏感应用中的在线流量调度

Unified Planning-Learning Framework for Robust UUV Navigation Under Partial Observability

部分可观测性下稳健的UUV导航统一规划-学习框架

IFlowNets: Extending Generative Samplers to Learn Strategies in Incomplete Information Games

IFlowNets:扩展生成采样器以学习不完整信息博弈中的策略

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations

搜索辅助联合代理-环境强化学习,实现带旋转的多智能体终生路径寻觅

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

LC-GRPO:基于流的GRPO与朗之文修正的串联推断间隙桥接

ChronoVision: Temporal Reasoning via Latent State Reconstruction

时间视觉:通过潜在状态重建进行时间推理

When Agentic AI Meets Integrated Sensing and Communication

当智能人工智能遇上综合感知与通信

On-Policy Delta Distillation for Multilingual Math Reasoning

多语言数学推理的策略上Delta提纯

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

M$^3$R-Bench:基于证据的多模态隐喻理解的统一基准

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

通过层级推理和话语级目标奖励提升LLM中的社会智力

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

AppDeltaWorld:移动图形界面代理的过渡接地Delta代码世界模型

VLMs for Videogame Data Annotation

用于电子游戏数据注释的VLM

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

在VLM注释数据集上训练条件化视频游戏代理

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:用于智能强化学习的递归自蒸馏

Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control

基于观察的自我预测强化学习用于视觉连续控制

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

超越平面政策:具身智能体机器人操作的层级后期培训

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:一种用于情感感知、理解与互动的统一多模态推理模型

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

ProDVI:用于值网络初始化的程序化动态先验

Hybrid-Adaptive Thread Tuning to Mitigate Simulation Execution Bottlenecks in High-Performance Reinforcement Learning Inference

混合自适应线程调优以缓解高性能强化学习推理中仿真执行瓶颈

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:通过硬否定实现统一多模态检索的以检索为中心的CoT

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文有帮助吗?北极航运中逆向强化学习的受控评估

Contextual Information Policy Optimization for Search Agents

搜索代理的上下文信息策略优化

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

iARCS:可控3D场景生成的迭代代理强化学习

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界演练内化环境动态以实现智能强化学习

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

DASH:政策内推理模型自我提炼的发散自适应监督视野

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

RRC:通过基于排名的奖励构建解锁LLM强化学习中的生成奖励模型

Keyword: diffusion policy

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo:专家指导的技能记忆框架,用于构成具身操作

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:多样化演示中合规机器人操作的可变阻抗扩散政策