生成时间: 2026-08-12 17:13:32 (UTC+8); Arxiv 发布时间: 2026-08-12 20:00 EDT (2026-08-13 08:00 UTC+8)

今天共有 33 篇相关文章

Keyword: reinforcement learning

SPOTting the Future: Lookahead Explanations for Deep Reinforcement Learning

洞察未来:深度强化学习的前瞻性解释

Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds

驾驭接近与安全平衡:行人人群中人类跟随的约束分解

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

合唱:高覆盖测试台刺激生成的补充专家

Procedural Fairness Failures in RLHF from Preference Averaging

RLHF中偏好平均法中的程序公平性失败

ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta

ConnectionMind:利用社交网络和大型语言模型实现Meta个性化推荐

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

安全强化学习的边界寻求策略梯度

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

通过自我碰撞避免参考,为人形生物在狭窄空间中导航的全身规划

Topological Feasibility Guarantees for Differentiable Predictive Control

拓扑可行性保证可微预测控制

Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

长远工具使用代理任务的高效强化学习

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:在潜在世界模型中实现采样高效自动驾驶的非政策学习

TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

TideRL:通过准备感知调度提升能动强化物流的善意输出

Threat-guided Policy-aware Scene Perturbation for Safe Autonomous Driving with Online Reinforcement Learning

威胁引导的政策感知场景扰动,支持安全自动驾驶,配合在线强化学习

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

无批评的高效在线强化学习微调预训练

Exploration-Driven Personalized Federated Reinforcement Learning via Intrinsic Motivation

探索驱动的个性化联合强化学习,通过内在动机

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升LVLM安全

An Asynchronous Triggered MAC Protocol for Underwater Acoustic Networks

一种用于水下声学网络的异步触发MAC协议

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

SKILLER:用于小型语言模型中可重复使用的技能提取的语言级强化学习

Reinforcement Learning-Based Laser Cutting Machine Parameter Optimization

基于增强学习的激光切割机参数优化

Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

通过可验证的情绪反馈实现双循环自我进化,实现多回合同理心对话

IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning

IADD-TR:基于模型的强化学习中的干预感知动力学解耦与目标正则化

Threshold-Based Spiking Neural Networks for Event-Driven Status Update Systems

基于阈值的尖峰神经网络用于事件驱动状态更新系统

Control of hybrid wind-wave energy systems using reinforcement learning

利用强化学习控制混合风波能源系统

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

FADE:从被动验证到主动发现,在反事实视频理解中

Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

多语言机器翻译开放大型语言模型的无引用后训练

MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

MoE代理模型用于LLM强化学习后低成本失败复制与诊断

MIRA: Medical Image Reflection for Agentic Diagnosis

MIRA:医学图像反射用于代理诊断

Partially Observable Learning for Multi-Platform Dispatch Optimization

多平台调度优化的部分可观察学习

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

基于证据的可信多模态推理与评估基准,适用于复杂城市场景

ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

ConRub-Med:基于共识评分标准的强化学习,用于开放式医学问答

Efficient Hypergradient Descent for Inverse Reinforcement Learning

高效的超梯度下降用于逆强化学习

Scheduling Mixed RL Rollouts Beyond Prefix Locality

调度混合强化学习推广超出前缀区域

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

测试时间自我演进的图形界面视觉基础,通过反思引导的政策自我蒸馏

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:具备可验证时间基础的元检测强化学习,用于AI生成视频取证

Keyword: diffusion policy

There is no result