<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>推理引擎 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/</link><description>Recent content in 推理引擎 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Thu, 20 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/index.xml" rel="self" type="application/rss+xml"/><item><title>MoNe: Modular Neural Memory for Efficient Long Context Inference 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-mone-modular-neural-memory-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-mone-modular-neural-memory-paper-reading/</guid><description>三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆，实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计：测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新；推理时仅从查询token生成KV，不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%（参数开销仅6.4%），RULER上S-NIAH 128K达0.96（ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持），且可泛化到骨干原生窗口远之外的长度。</description></item><item><title>Infra 的浪漫与 AI 平权：盛颖从 SGLang 到 RadixArk</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</guid><description>SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk（1 亿美元种子轮）的完整路径。她提出 Infra 不应是 support 角色，而应成为产品本身；RadixArk 的使命不止于推理引擎，而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境，以及一位女性研究者在技术圈中的真实体验。</description></item><item><title>GPU其实很闲：AI Infra四层架构与榨干硅极限的效率革命</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</guid><description>当AI行业的重心从训练转向推理，一个被忽视的事实浮出水面：GPU大多数时间其实很&amp;quot;闲&amp;quot;。Azure推理负载高达65%的能耗消耗在空转等待上，OpenAI的Chat类请求也达到52%。本文基于硅谷101播客，系统梳理AI Infra四层架构，拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术，把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。</description></item><item><title>清华程序员很聪明：清程极智如何把Token成本砍掉75%——AI Infra创业的降本逻辑</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-qingcheng-jizhi-ai-infra-token/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-qingcheng-jizhi-ai-infra-token/</guid><description>清华系AI Infra创业公司清程极智（八卦炉+赤兔推理引擎+AI Ping）联合创始人师天麾深度访谈。高二信息学奥赛金牌保送清华、博士师从翟季冬做高性能计算，2023年底创立公司，一年融资过亿。本篇梳理其核心观点：为什么推理引擎是AI的操作系统、赤兔如何通过FP8/FP4让四台服务器变一台、Token经济爆发后AI Infra被投资人追着投、以及Token服务市场为何是个&amp;quot;黑盒&amp;quot;。</description></item></channel></rss>