生成时间: 2026-08-06 18:41:31 (UTC+8); Arxiv 发布时间: 2026-08-06 20:00 EDT (2026-08-07 08:00 UTC+8)

今天共有 24 篇相关文章

Keyword: reinforcement learning

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:视频理解与问答中的动态潜在推理

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(Agentic)

ATLAS: Adaptive Topological Learning with Abstract Successors for Continual Learning

ATLAS:带有抽象继承者的自适应拓扑学习以实现持续学习

Generative Optimization for Incentivized Advertising with Global Level Constraints

针对全球层级约束的激励广告生成优化

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:使用统一多模态模型进行代理图像生成的工具

MCHA: A Memory-Centric Hierarchical Architecture for Parallel-Sequential Computing

MCHA:一种以内存为中心的并行顺序计算分层架构

Energy Efficient AI-Enabled Wireless Sensor Networks for Mission Critical Environments: A Systematic Review across Smart Grid, AI, and Urban Infrastructure Applications

适用于关键任务环境的节能AI无线传感器网络:跨智能电网、人工智能及城市基础设施应用的系统综述

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大型语言模型的智能系统

Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

在推理模型中评估心智理论:稳健性胜于推理

Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning

人工内疚校准:神经基础奖励塑造,用于亲社会多代理强化学习

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

教导MLLM说“不”:通过拒绝校准GRPO进行广义指称表达理解

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观察校准自蒸馏的能动强化学习

Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation

特权但有偏见:受PI条件反射的教师如何打破自我提炼

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3

PRIMAL3:通过强化与模仿多智能体学习实现路径寻路——利用LaCAM3

State2State: Environment-Derived Mid-Training for LLM Agents

State2State:面向LLM代理的环境衍生中期培训

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll:为推测强化学习推广的快速-慢速验证器-反馈适配

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:面向长期视野视频世界模型的自我验证强化学习

ORACLE: A Multi-Objective Reinforcement Learning-Based Analog Circuit Design Optimizer with Large Language Models-Guided Exploration

ORACLE:一款基于大型语言模型引导探索的多目标强化学习模拟电路设计优化器

Exact Model-Free Policy Iteration for Co-safe LTL Planning

共同安全LTL规划的精确无模型政策迭代

Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

优化政策可学习内容:可恢复性意识的推广干预学习

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

ABSeeker:通过回溯信用分配培训长远搜索代理

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

特工对特工:自动即时注入红队的智能系统

Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

奖励结构塑造了情节探索与强化学习中神经记忆之间的互动

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Argus:用于长期视野推理的通用智能运行时间

Keyword: diffusion policy

There is no result