生成时间: 2026-08-28 02:56:06 (UTC+8); Arxiv 发布时间: 2026-08-27 20:00 EDT (2026-08-28 08:00 UTC+8)

今天共有 30 篇相关文章

Keyword: reinforcement learning

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

FAMPWQ:基于费舍尔信息的自适应混合精度权量化,用于有效LLM推断

Demystifying Reinforcement Learning Post-Training of Language Models

解读语言模型训练后强化学习的神秘面纱

AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions

AFDBench:一位以推理为先的人工智能科学家,参与国家气象局预报讨论

Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning

通过多目标强化学习实现可靠、可概括且具体的上下文知识编辑

Bayesian Flow Networks for Offline Trajectory Planning

贝叶斯流网络用于离线轨迹规划

Simulating Cognitive Smart Freight Corridors with Agent-Based Models and Reinforcement Learning

利用基于代理的模型和强化学习模拟认知智能货运走廊

From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection

从记忆到吸收:混合策略强化学习用于持续知识注入

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

PointRL:从可验证的注释证据中学习点级视觉语言基础

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

超越成对反馈:基于偏好的奖励学习中的列表式视觉-语言监督

Where vs What: Decomposing Structural and Content Failures in LLM-Generated Structured Outputs

哪里与什么:分解LLM生成结构化输出中的结构性和内容失败

Traffic-Adaptive Per-Hop Multipath Routing in Multi-Hop UAV Networks

多跳无人机网络中的流量自适应每跳多径路由

Lightweight AI for UAV-Mounted RIS: An Overview

无人机安装RIS的轻量级人工智能概述

LAC: Linear and Angular Compliance for Humanoid Whole-body Control

LAC:人形全身控制的线性和角度顺应性

BVR Sim: An Open and High-Throughput Environment for Heterogeneous Air-Combat Reinforcement Learning

视距模拟:一个开放且高通量的异构空战增援学习环境

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:扩展的统一基准测试和多模型框架,用于评估视频美学和生成质量

Training Alignment Auditors via Reinforcement Learning

通过强化学习培训对齐审计员

AERIS: Offline Policy Improvement for Multi-UAV Integrated Sensing and Communication

AERIS:多无人机综合感测与通信的离线政策改进

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

代理游戏开发作为可验证轨迹数据引擎用于缩放世界模型

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:基于文学长篇叙事的精简大型语言模型的奖励引导双代理证据推理

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:视频深度研究中的自适应工具使用与反思

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

V评分标准:通过基于评分标准的强化学习实现视觉忠实

AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification

AutoVerifier:基于参考的答案验证的残差引导非参数优化

TailSFT: Filtered Fine-Tuning Improves Post-Training Performance

TailSFT:过滤微调提升训练后表现

Cooperative Multi-Agent Reinforcement Learning for Adaptive Aggregation in Semi-Supervised Federated Learning with non-IID Data

半监督联合学习中非IID数据中的合作多智能体强化学习,用于自适应聚合

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence

答案很廉价,给我看证据!以证据增强自动化脆弱性评估

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

一个症状,三把杠杆:政策自我提炼的批判性回顾

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:多模态教学跟踪的代理自我演化数据综合

Prefix Sliding for efficient test-time scaling

前缀滑动以实现高效的测试时间缩放

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:一套可扩展且可验证的原生视觉推理套件

Keyword: diffusion policy

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

VISTA:视觉推断空间接触感知,用于丰富接触操作