生成时间: 2026-09-29 00:32:17 (UTC+8); Arxiv 发布时间: 2026-09-28 20:00 EDT (2026-09-29 08:00 UTC+8)

今天共有 32 篇相关文章

Keyword: reinforcement learning

From Weak Data to Strong Policy: Q-Targets Enable Provable In-Context Reinforcement Learning

从弱数据到强策略:Q-目标实现可证实的上下文强化学习

Privacy-Preserving Prompted Policy Search for Robotic Control

保护隐私的提示策略 机器人控制搜索

SoGuDiff: Socially Guided Diffusion for Steerable, Norm-Grounded Robot Navigation

SoGuDiff:社会引导扩散,用于可转向、规范基础的机器人导航

MOCHA: Multi-Objective Co-Design using Hypernetwork Architectures

MOCHA:利用超网络架构进行多目标协同设计

HuGo: LLMs as Whole-Body Policy Code Designers for Humanoid Loco-Manipulation

HuGo:大型语言模型作为人形机车操控的整体政策代码设计者

Probabilistic Robustness-driven Universal Adversarial Perturbations with Explainability against Deep Reinforcement Learning-based Intrusion Detection System

基于深度强化学习的入侵检测系统,具有可解释性的概率性鲁棒性驱动的普遍对抗扰动

MVAgent: Multi-Agent Video Generation via Consistent Condition Construction and Shot-Level Policy Optimization

MVAgent:通过一致的条件构建和镜头级策略优化实现多代理视频生成

OpenHail: An Event-Driven Gymnasium Environment for Electric Ride-Hailing Fleet Control

OpenHail:一个以活动为驱动的电动网约车车队控制体育馆环境

Learning Vision-Based Agile Gap Traversal: Differentiable Simulation with a Warm-Started Critic

基于愿景的敏捷差距穿越学习:带着热启批评者的可微分仿真

MM-VeriAgent: Learning to Use Extensive Tools to Verify Multimodal Misinformation with Reinforcement Learning

MM-VeriAgent:学习使用大量工具通过强化学习验证多模态错误信息

WeEnv: The Environment for Agentic Reinforcement Learning at WeChat

WeEnv:微信中的能动强化学习环境

Learning Chance-Constrained MDPs with Bellman Distributional Certificates

学习机会受限的MDP与贝尔曼分配证书

VLaRL: Augmenting Vision-Language-Action Models with Simulation-Trained Latent-Conditioned Residual RL

VLaRL:用仿真训练的潜条件残留强化学习增强视觉-语言-行动模型

QReason: Query-Focused Decoupled Chain-of-Thought for Efficient Passage Reranking

QReason:以查询为中心的解耦思维链,促进文书重新排序

ToolSearcher: Optimizing Tool Selection at Scale via Reinforcement Learning

ToolSearcher:通过强化学习大规模优化工具选择

PORL: Pretrained Offline Reinforcement Learning for the Job Shop Scheduling Problem

PORL:针对工作坊排班问题的预训练离线强化学习

MVVBench: Benchmarking 4D Reasoning in Vision-Language Models

MVVBench:视觉语言模型中四维推理的基准测试

Robust Successor Features

稳健的继任功能

Precision at Speed: Sample-Efficient Online Model-Based Reinforcement Learning for Hydraulic Excavator Control

高速精度:液压挖掘机控制的高效在线模型基础钢筋学习

Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents

抽象阶梯的上下:语言代理的基于代码的技能

Monitor Jailbreaking: Evading Chain-of-Thought Monitoring Without Encoded Reasoning

监控越狱:无编码推理规避思维链监控

JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models

JevAdvBench:校准决策模型中强化学习的基准与黑盒攻击

Deep Reinforcement Learning for Misbehavior Detection Under Partially Observable V2X Data

在部分可观测的V2X数据下进行不良行为检测的深度强化学习

MA-WAM: Multi-Agent World-Action Model for Test-Time Planning

MA-WAM:多智能体世界行动模型用于测试时间规划

G2MAF: Test-Time Gradient Guidance for Multi-Agent Flow Policies

G2MAF:多智能体流策略的测试时间梯度指导

Dynamic Sampling for Telemetry in Microservices: A Reinforcement Learning and Entropy-Based Approach

微服务遥测的动态采样:一种强化学习与基于熵的方法

See to Reach, Feel to Grasp: Learning A Blind Grasp Reflex for Anthropomorphic Robotic Hands

看到够到,感觉到抓握:学习拟人化机器人手的盲抓反射

Adaptive Switching Between Leader-Based and Leaderless BFT Protocols

基于领导者与无领导者的BFT协议之间的自适应切换

HySTAR: Anchored Hypergraphs for Stable Credit Assignment in Cooperative Multi-Agent Reinforcement Learning

HySTAR:合作多智能体强化学习中稳定学分分配的锚定超图

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

学会停止而不学会停止:自我监督自信训练提升推理效率

Keyword: diffusion policy

Policy-Calibrated DAgger: Offline Calibrated Noise Injection for Imitation Learning

策略校准DAgger:用于模仿学习的离线校准噪声注入

Aerial Manipulation in the Wild with Onboard Perception, Policy Learning, and Whole-Body Control

野外空中操控,结合机载感知、策略学习和全身控制