生成时间: 2026-09-11 20:40:41 (UTC+8); Arxiv 发布时间: 2026-09-11 20:00 EDT (2026-09-12 08:00 UTC+8)

今天共有 24 篇相关文章

Keyword: reinforcement learning

An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

IMO金牌的开放配方:奥林匹克数学训练Nemotron

A Bellman Optimality Equation for Plasticity

可塑性的贝尔曼最优方程

From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs

从连接到奖励:带定向状态图的密集奖励学习

Expressive Robotic Pianist: Mastering Complex Piano Repertoire with Graph-Mimic and Musical Dynamics

表现力机器人钢琴家:利用图模拟与音乐动态掌握复杂钢琴曲目

Certifying Lower Bounds for Risk-Sensitive Reinforcement Learning under Adversarial State Perturbations

在对抗状态扰动下,风险敏感强化学习的下限认证

Topological Necessities: Mechanism-Invariant Strategic Subgoals for Cross-Embodiment Goal-Conditioned Control

拓扑必然性:跨具身目标条件控制的机制不变战略子目标

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

T1:面向长期任务的终端代理强化学习

Fork Where the Model Changes Its Mind: Belief-Shift Branching for Tree-Structured Reinforcement Learning

模型改变主意的地方分支:树状结构强化学习中的信念转移分支

Learning Realistic Athletic Sprinting Without Demonstrations

学习无示范的真实运动短跑

Quantifying the Reality Gap for RL-Based UAV Placement at mmWave and Sub-THz

量化基于强化学习的无人机在毫米波和亚太赫兹波段的现实差距

KuaiRP Series Role-playing Models Technical Report

KuaiRP系列角色扮演模型技术报告

DRG-MAPPO: Hierarchical Dynamic Role-Graph Multi-Agent Reinforcement Learning for Cooperative Air Combat

DRG-MAPPO:分层动态角色图多智能体强化学习,用于合作空战

From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

从评估到提升:视频生成模型的基准测试与视频思维推理的改进

Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy

超越噪声引导:生成式机器人政策中的双潜空间强化学习

SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQ

SEAR:弱到强多语言语音选择题的片段证据感知路由

Safety-aware Skill Adaptation for Reinforcement Learning in Dynamic Environments

动态环境中强化学习的安全意识技能适应

Harnessing Intrinsic Subject-Aware Attention for Controllable Multi-Subject Video Generation

利用内在的主体感知注意力实现可控多主体视频生成

Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language

训练后零射击TTS通过自然语言实现细致的情绪和持续时间控制

Distributed Optimization of Modular Production Systems using Model-based Reinforcement Learning with Inverse Models

利用基于模型的强化学习与逆模型进行模块化生产系统的分布式优化

Negative Self-Distillation: Learning to Reason by Avoiding Flaws

负自我提炼:通过避免缺陷来学习推理

Reflex-Informed Neuromuscular Reinforcement Learning for Muscle-Driven Locomotion

反射知情的神经肌肉强化学习,用于肌肉驱动的运动

Rapid Learning of Dexterous In-Hand Pen Writing through Real-Time Jacobian Estimation

通过实时雅可比估计快速学习灵巧的手持笔写

MindTopo: Can Foundation Models Reason in Topological Space?

MindTopo:基础模型能在拓扑空间中推理吗?

SenseNova-U1.5: Towards Native Unified Visual Intelligence

SenseNova-U1.5:迈向原生统一视觉智能

Keyword: diffusion policy

There is no result