<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>AGI on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/agi/</link><description>Recent content in AGI on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 31 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/agi/index.xml" rel="self" type="application/rss+xml"/><item><title>GPU其实很闲：AI Infra四层架构与榨干硅极限的效率革命</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</guid><description>当AI行业的重心从训练转向推理，一个被忽视的事实浮出水面：GPU大多数时间其实很&amp;quot;闲&amp;quot;。Azure推理负载高达65%的能耗消耗在空转等待上，OpenAI的Chat类请求也达到52%。本文基于硅谷101播客，系统梳理AI Infra四层架构，拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术，把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。</description></item></channel></rss>