生成时间: 2026-08-14 17:08:44 (UTC+8); Arxiv 发布时间: 2026-08-14 20:00 EDT (2026-08-15 08:00 UTC+8)

今天共有 21 篇相关文章

Keyword: reinforcement learning

Multi-AUV Ad-hoc network-based Target Tracking: A Value Gradient Guidance Multi-Agent Diffusion Reinforcement Learning Approach

多AUV基于自组网络的目标跟踪:一种数值梯度引导多智能体扩散强化学习方法

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

推理陪审团:多模型共识评估推理痕迹

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:利用Evolution Strategies提升LLM解决方案覆盖范围

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆代理:基于经验的程序记忆,用于空间智能

Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry

信息不对称的分集式马尔可夫决策过程中的去中心化多玩家Q-学习

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

超越结果奖励:深度搜索代理的步骤级自我提炼策略优化

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维MLM中的基准对标与反应行为的对齐

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

HumanoidVLN:基于物理的模拟器和跨类人形态视觉语言导航的基准测试

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测,通过对抗性编辑数据进行

Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

通过基于近距离的奖励建模,迈向深度强化学习中的社会合规导航

Momentum as Residual-Driven Multiplier Correction for Deep Learning Optimization

动量作为深度学习优化的残差驱动乘数修正

Multi-perspective Imbalance-Conscious 6G Beamforming Optimization and Performance

多视角不平衡意识的6G波束成形优化与性能

A Deep RL based Framework for Targeted White Matter Tractography

基于深度强化学习的靶向白质牵引图框架

OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

OGR-MARL:受限港口水道中异质USV合作追踪的选项引导残余多代理强化学习

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间GRPO:视觉-语言-行动强化学习中的超越轨迹级学分

Pareto-Aware Hierarchical Reinforcement Learning for Online Resource Allocation in RIS-assisted Large-Scale IoT Systems

帕累托感知层级强化学习用于RIS辅助的大型物联网系统中的在线资源分配

AoI-Guaranteed Dynamic Route Planning for Connected Vehicles

AoI保证的互联车辆动态路线规划

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

教导规模,而非方向:多回合多步LLM代理的验证者界限信用分配

Rules or Character? Scaling Laws for AI Safety Design

规则还是角色?人工智能安全设计的尺度法则

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:自动驾驶中视觉-语言-行动模型的失败知情自我进化

Intern-S2-Preview: Scientific Agentic Foundation Model

实习生第二季预览:科学代理基金会模型

Keyword: diffusion policy

There is no result