<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>GRPO on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/grpo/</link><description>Recent content in GRPO on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 08 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/grpo/index.xml" rel="self" type="application/rss+xml"/><item><title>EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</guid><description>蚂蚁集团与上海交通大学联合提出 EnvACE，让一个策略同时扮演「行动者」和「环境」两个角色：Acting 角色生成工具调用，Rehearsal 角色生成对应的环境响应，两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互，却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline，综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是，模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling，在提交执行前先在内部排练验证，把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」，并提炼出三条可迁移到其他领域的通用灵感。</description></item></channel></rss>