<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>开源模型 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 开源模型 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 30 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Encoder-Free Scaling Laws × UMM-Reflection：统一多模态模型的架构与反思双问 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-multimodal-duet-paper-reading/</guid><description>本精读合并解读两篇直指「统一多模态模型」根本问题的论文：腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯（1.1B–44B 总参）与同数据同优化设置的受控对比，首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠（γ 0.0973 vs 0.0979），多模态目标 encoder-free 当前更差但下降更快（γ 0.3778 vs 0.2998），外推交叉点 6.1×10²¹ FLOPs（比旗舰模型预训练算力低约三个数量级），分主题 STEM 最早追平、OCR/Caption 最晚，配注意力质量（0.217→0.645）+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学；NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样（K=16 兄弟轨迹共用一张 detach 初始图，组优势只比反思策略不比首抽运气）+ 整轨迹单一优势同时更新文本头与流头，GenEval 从 0.71 升至 0.84（超 SFT +12.05 点）、条件修复率 20.59%→64.94% 翻三倍，换指令实验（48.4% vs 20.5%）与线性探针（AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%）证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题（要不要视觉编码器），一篇回答后训练的能力问题（会不会自我反思），合成统一模型路线的完整纵切面。</description></item><item><title>编码智能体规划、信任原生 Agent OS 与开源后训练配方：三篇系统论文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</guid><description>本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》：现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略，平均成功率反超手工 TAMP planner（95%/82% vs 47%），决策速度毫秒级，为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》：提出首个以安全为第一设计约束的智能体操作系统，用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播，把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》：Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方，9.01M 样本 SFT 加多阶段 RL，IFBench 76.9 对官方 33.6，并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。</description></item><item><title>DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-19-deepseek-v4-1-flash-paper-reading/</link><pubDate>Sat, 19 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-19-deepseek-v4-1-flash-paper-reading/</guid><description>DeepSeek-V4.1-Flash 用三件武器把长上下文智能体的部署成本打下来：CED 非对称架构让 prefill 只激活 8B 参数（decode 16B），CSA2 跨层 KV 复用 + FP4 量化把全局 KV 缓存压到 890 字节/token（较 V1 降 437 倍），SWA Bounded Replay 把持久化缓存再压到 1/8。在 Codeforces 3348→3471、DeepSWE v1.1 达 74.2% 的同时，45T token 多模态预训练完全开源。本文拆解其架构因果链与&amp;rsquo;智能体负载第一性&amp;rsquo;的设计哲学。</description></item><item><title>LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-limix2-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-limix2-paper-reading/</guid><description>Stable AI 与清华大学联合发布 LimiX-2，用「上下文机制网络（CMN）」范式重新定义表格基础模型：预训练目标从 PFN 的『预测指定标签列』改为 CCMM 的『对任意掩码列做联合分布建模』，让每个样本内所有列都成为监督源。在 TabArena 上以 Elo 1935 领先第二名 TabFM+ 117 分、参数量却只有对方四分之一，还意外获得了因果骨架恢复能力。本精读拆解其『从预测标签到建模机制』的范式转移、SCM 合成数据引擎设计，以及这一思路对结构化数据智能的普适意义。</description></item><item><title>SSD-LLaMA 精读：单张 RTX 5090 跑万亿参数 MoE 的 SSD 原生推理系统</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-ssd-llama-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-ssd-llama-paper-reading/</guid><description>港科大联合中科院深圳先进院、南科大发布 SSD-LLaMA：面向万亿参数 MoE 的 SSD 原生本地推理系统——SSD I/O 流水线优化专家投递、SSD-RAM-VRAM 三层存储动态驻留、CPU-GPU 均衡混合执行，保证每个选中专家无剪枝无替换。三大前沿 MoE 家族上 prefill 提速 1.52–4.19×、decode 提速 2.10–15.58×，单张 RTX 5090+32GB RAM 实现万亿模型 &amp;gt;1 token/s。本精读拆解『把带宽受限问题转化为层次调度问题』的系统设计。</description></item><item><title>OPEN-1B: A Fully Auditable Training Run 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-open1b-auditable-training-run-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-open1b-auditable-training-run-paper-reading/</guid><description>开源 LLM 即使放出全部数据与配方，也因浮点非结合性无法逐位复现——你无法验证发布的 checkpoint 真是声明的配方训出来的。Gensyn 的 OPEN-1B 定义第四层透明度&amp;rsquo;完全可审计&amp;rsquo;：RepOps 跨硬件逐位复现算子（固定规约序、统一 FMA/次正规数约定、计数器式 RNG）、拓扑不变数据流（token 流=种子的纯函数）、确定性 butterfly all-reduce，多审计者各验若干步拼出全程、整跑收敛为单一哈希。代价是 MFU 从一个数量级掉到 5%——可验证性与速度的明码标价，以及首个该层级的开源 LLM 全套产物。</description></item><item><title>Atria Dawn: The Dawn of Agentic Superintelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-atria-dawn-open-agent-foundation-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-atria-dawn-open-agent-foundation-paper-reading/</guid><description>上海人工智能实验室发布 744B MoE 开源 Agent 基座 Atria Dawn Preview：以 Verifiable Experience Pipeline 把训练信号锚定在可执行环境与外部可验证结果上，16 基准中 5 个登顶（Terminal-Bench 2.1 = 90.2、SWE-bench Pro = 74.7）；更独特的是把自身 769 条任务记录的 R&amp;amp;D 过程作为人机协作案例研究——1/3 任务被人类评为无 AI 不可行。本精读覆盖可验证经验管线的设计逻辑、五榜登顶的机制根源、以及模型报告与 HAI 研究双重身份的方法论价值。</description></item><item><title>Salesforce Koa: An Enterprise Language Model for Agentic Tool Use 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-salesforce-koa-enterprise-agent-model-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-salesforce-koa-enterprise-agent-model-paper-reading/</guid><description>企业 Agent 工具使用模型的开放权重范本：Salesforce 基于 Nemotron-3-Super-120B（NVIDIA 开源基座）GRPO 后训练出 Koa，在 Dreamforce 发布并作为 Agentforce 平台可选模型。核心是 simulation-to-reward 管线——把工作流规格展开为 persona 条件多轮任务、以成功工具使用为基础的任务解决奖励；企业域用 Agent Script 声明式语言书写规格，训练零客户数据。Tau2Bench 69.41 超基座，且揭示 SFT/RL 的能力分工：BFCL 多轮上 SFT 反降分（54.12→53.25）而 RL 提升。本精读覆盖声明式规格→模拟器→奖励的生成管线与开放权重的企业模型经济学。</description></item><item><title>ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-zgcm1-open-efficient-foundation-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-zgcm1-open-efficient-foundation-paper-reading/</guid><description>ZGCM-1 技术报告解读：中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一（AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%），Agentic Search 与大数量级前沿模型竞争。配方亮点：混合 RL + Agent-SFT（verifier-successful 15,748 轨迹子集）与 AI-Native R&amp;amp;D——用 30B token 代理模型做混合物搜索，把配方探索成本降一个量级后再全量训练。本精读按&amp;rsquo;开放配方&amp;rsquo;口径解读其训练经济学与开放科学价值。</description></item><item><title>Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-occamy-open-35b-cowork-model-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-occamy-open-35b-cowork-model-paper-reading/</guid><description>Accio-Lab 的开放 35B-A3B co-work 模型技术报告：基于 Qwen3.6-35B-A3B 再训练，核心主张是成本效率路线——日常 co-work 的多数步骤（状态追踪/协调/恢复/跟进）不需要前沿级推理，执行接地的数据与环境（可重放长时程轨迹+多 harness 采集）+ 分阶段后训练，在 12 个 benchmark 四能力域上做到同规模最强、部分任务比肩 GPT-5.6 Sol 级大模型，价格协议明示的性价比优势。</description></item><item><title>Nemotron IMO Gold 精读：开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</guid><description>NVIDIA 公开 IMO 2026 金牌系统全部配方：Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint，加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选，全程纯自然语言（无形式化证明器/外部工具/互联网），得分 30/42 达金牌线。全套 artifact 开源：两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench（200 道新题）。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。</description></item><item><title>Gander (Omni Interaction Agent Technical Report) 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-gander-omni-interaction-agent-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-gander-omni-interaction-agent-paper-reading/</guid><description>腾讯混元语音与浙大等团队的 Gander 用&amp;rsquo;小脑-大脑&amp;rsquo;协作框架统一了全双工实时交互与长程 Agent 执行：9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断，大脑免训练接入 Codex/Claude Code 执行长任务，编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%（GPT-Realtime 13.5%）；SpokenQA 全双工组第一。模型、代码、数据全部开源。</description></item><item><title>Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-minima-gdn-4bit-quantization-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-minima-gdn-4bit-quantization-paper-reading/</guid><description>社区量化混合架构 LLM 时一致保留循环半区（Gated DeltaNet）的高精度，理由是&amp;rsquo;循环误差会累积&amp;rsquo;。Minima 直接把 NVFP4 W4A4 打满全部 496 个线性层：五任务平均仅 -0.52（种子噪声内），显存 17.5 GiB 最小、prefill 提速 14-19%。四重机制研究（块缩放局域化离群值→门控非线性压缩误差→delta-rule 主动遗忘→逐 token 代价被冲刷）解释了为什么直觉是错的。</description></item><item><title>Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</guid><description>在 IOI 2026 上，一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分，超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径：22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距，以及&amp;rsquo;纯 SFT 的 Ultra 反超 SFT+RL 的 Nano&amp;rsquo;背后的并行采样机制。</description></item><item><title>On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-qwen38-next-architecture-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-qwen38-next-architecture-paper-reading/</guid><description>Qwen Team 的 Qwen3.8-Flash-Next 架构报告展示了一次教科书级的&amp;rsquo;联合设计&amp;rsquo;实践：GDN 线性注意力混合 + 压缩索引稀疏注意力（QSA）+ 四分支门控残差 + 主机内存 n-gram 嵌入，125B 总参 6B 激活的模型以约 1/9 训练 FLOPs 在 14 个基准上 8 个超越 397B 旗舰，1M 上下文预填充加速 7.6 倍，且 4 倍学习率压力测试下全程零 loss spike。报告最宝贵的不是单个组件，而是&amp;rsquo;loss、基准、效率、稳定性必须当一个问题解&amp;rsquo;的方法论，以及大量&amp;rsquo;loss 与下游精度背离&amp;rsquo;的诚实披露。</description></item><item><title>A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-baj-merged-jailbreak-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-baj-merged-jailbreak-paper-reading/</guid><description>RIKEN AIP、东京科学大学与浙江大学团队提出并利用了模型合并家族的族级越狱威胁：即使所有成分模型都独立安全对齐，从同一预训练骨架派生的合并模型仍共享源自骨架的脆弱方向。BAJ 方法把越狱后缀生成形式化为合并空间上的 min-max 优化，用任务算术参数化盆地，交替执行后缀变异搜索与合并系数梯度上升，迫使后缀攻破全族最难攻击的构型。六个主流骨架上族级迁移成功率 61.3-89.1%，领先最强基线 22-34 点；跨六种合并方法、水印与量化部署依然有效；Perplexity 等现有防御几乎无效。消融证实：系数最大化搜索换成随机采样 TSR 从 65.8 跌至 32.4，攻击普通微调模型降至 27-51%，跨骨架迁移显著弱于同骨架——证明漏洞确实源自预训练骨架且由合并结构暴露。</description></item><item><title>Affix Cache for Diffusion Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-acache-dllm-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-acache-dllm-paper-reading/</guid><description>扩散语言模型（DLLM）以双向注意力实现并行解码，但也因此丧失了自回归模型前缀缓存的红利——共享文本段的 KV 状态与不断演化的生成 token 相互耦合，直接跨请求复用会立刻过期。本文提出 ACache：在请求开始时用一次跨注意力探针找出少数对生成 token 影响最大的『锚点令牌』，之后只重算锚点与请求特有位置的 KV，其余共享段缓存跨请求复用。在 LLaDA-8B 与 Dream-7B 上，约 20% 锚点率即可恢复大部分精度损失；基于 Nano-vLLM 的原型将重算延迟最高降低 55.7%，端到端吞吐最高提升 1.68 倍，峰值 KV 显存最高下降 43.3%。这项工作首次把『跨请求缓存复用』引入 DLLM 推理系统，揭示了双向注意力下共享上下文管理的新范式。</description></item><item><title>LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-lowrankarena-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-lowrankarena-paper-reading/</guid><description>SVD 低秩压缩号称能省显存又保精度，但各家论文的评测基准、压缩率定义、推理后端各不相同，「进步」到底是方法变强还是协议不同造成的？杜克大学与维克森林大学团队发布 LowRankArena：统一任务版本（LM-Eval-Harness v0.4.11）、统一精度下的 keep ratio 定义、统一 vLLM 0.18.1 端到端推理测量，并开放 3TiB 以上压缩 checkpoint 动物园。对 5 种代表方法（ASVD、SVD-LLM、DoBi-SVD、Basis Sharing、MoDeGPT）×3 个骨干模型的对齐审计发现：排名随骨干剧烈变动、MCQ 准确率可掩盖困惑度坍塌（ASVD 0.353 恰好贴着 0.357 随机地板）、低秩省的是 FLOPs 而非时间——prefill 提速最高 4.20 倍，decode 场景 SVD-LLM 吞吐反而跌到 0.80 倍，且 5 个方法在单张 H200 上压缩 70B 全部因工程问题失败。</description></item><item><title>Survival-Guided Length Control for Efficient Diffusion Language Models 精读：用生存分析一次前向测出生成长度</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-survival-dllm-length-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-survival-dllm-length-paper-reading/</guid><description>扩散语言模型（DLM）迭代去噪生成文本，但标准 AOAR 解码对全体样本使用统一的保守长度预算 Lmax=1024，大量去噪步浪费在精修真实结束位置之后的冗余画布上。本文把生成长度选择重新表述为 [EOS] token 上的离散时间生存问题：对长 mask 画布做一次前向传播，把各位置的 [EOS] 概率解释为危险率，经均场近似连乘得生存曲线，再用期望等于生存概率求和的标准恒等式闭式算出期望长度，作为该样本的解码预算。方法免训练、即插即用，在 LLaDA-8B-Base 与 Dream-7B-Base 上取得 3.1-6.6 倍解码加速（instruct 模型最高 7.3 倍），任务精度变化全部落在标准差之内；固定均值长度消融与逐步漂移分析进一步证明逐样本长度预测的必要性。</description></item><item><title>VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</guid><description>南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA（Vision-Free Adaptation），在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量：在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量，再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中，视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64，文化视觉推理 MaRVL 增益最大（Idefics3 +36.17），通用多模态能力持平或略升；而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34，训练成本约 10 A100 小时对 320 A100 小时，且框架可迁移到视觉编程等非多语言任务。</description></item><item><title>Skill Issue: Are Skills Language-Invariant in LLMs? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-skill-language-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-skill-language-paper-reading/</guid><description>深度精读 A*STAR、Weizmann、MIT-IBM Watson AI Lab、Cambridge 与 EleutherAI 合作的跨语言技能不一致性测量论文——同一模型的两个实例在规则/状态/动作空间完全固定、仅语言界面不同的文字博弈中对战，共 51.84 万局自博弈，首次把「技能的语言条件化」从知识获取问题中正交分离出来。发现英语界面一致最强、希伯来语最弱；语言敏感度因博弈而异（Colonel Blotto 平均 1.07 最大、Kuhn Poker 0.13 最小）；Nim 博弈的最优策略在阿/希界面下「存在但不可达」，且多数策略提及来自中途自发切换拉丁字母推理的对局；把推理语言换成英语可恢复 Gemma 德语界面 TTT 损失的 89.4%。语言影响的是决策的多个阶段，不只是输入理解。</description></item><item><title>领读Kimi K3技术报告：一个清华架构博士眼中的注意力谱系与「有效scaling」</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</guid><description>一集面向技术读者的Kimi K3技术报告领读播客，嘉宾孙宇涛（清华计算机系博士生、上海创智学院pre-doc，研究方向LLM架构与预训练）从K3出发串联起十多篇前作，把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加，讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design，MLA+QK-norm式门控的稳定性逻辑，Latent MoE对通信开销的削减，以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推；后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论：大模型架构没有本质创新了，K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率，而把size做work才是真创新。</description></item><item><title>Apodex 1.1: Scaling Agentic Intelligence for Complex Work 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-apodex-1.1-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-apodex-1.1-paper-reading/</guid><description>Apodex 1.1（Apodex Team）提出&amp;rsquo;双扩展面&amp;rsquo;范式：把任务环境构建（Environment Scaling）与多智能体协调（Agentic Coordination Scaling）确立为与模型规模并列的两个扩展维度。Agent Team 架构把任务分解、异步委派、非对称验证、重规划训练进模型策略，在 GDPVal 拿到 78.8 win rate、IMO-2026 数学超金牌线、SWE-bench Verified 77.7%，且全部开源（含 35B mini 版权重）。本精读重点拆解其&amp;rsquo;正向便宜、逆向昂贵&amp;rsquo;的验证器设计与 Agent Team 协调增益的机制来源。</description></item><item><title>两天十万Star：DeepSeek Harness 的开放逻辑，与它想要驯服的模型-脚手架-算力飞轮</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-deepseek-harness-open-strategy/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-deepseek-harness-open-strategy/</guid><description>围绕 DeepSeek Harness 发布后两天破十万 Star 的现象，三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理，聊到程序员岗位转型、开源生态与国产算力差距。核心判断：Harness 是 AI 时代的脚手架，插件化+开源让社区共建成本降到极低，模型与脚手架会互相塑造，而程序员的护城河正从写代码转向定义需求与验收结果。</description></item><item><title>MidTool: 面向Agent工具使用的中期训练数据合成 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</guid><description>工具使用是 LLM Agent 的核心能力，但此前几乎全靠后训练习得。MidTool（华盛顿大学 + Snowflake + UNC，工作完成于 Snowflake 实习）提出首个面向通用工具使用的开放中期训练语料管线：从网页、PDF、代码、真实 API 与 MCP 技能四类源出发，经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix，中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上，两种后训练配方下均一致超过 SFT-only 基线，RL 通常进一步放大增益，MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。</description></item><item><title>One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-thinkingbox-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-thinkingbox-paper-reading/</guid><description>微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准：507 个政策条件化的有状态业务工作流，覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域，用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%，pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%，暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟；79,853 次失败试验中 80.88% 干净终止且含写操作，证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。</description></item><item><title>FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-flashprefill-v2-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-flashprefill-v2-paper-reading/</guid><description>深度精读中科院自动化所、国科大与腾讯微信联合发表的 FlashPrefill V2——面向长上下文 LLM 服务的训练免费块稀疏 prefill 注意力方案。针对前作「精度失控、内核落后、不兼容生产引擎」的三重差距，V2 以块均值校正补偿被剪枝块的注意力贡献、以对齐 FA3/4 的 warp 特化稀疏内核兑现稀疏收益、以原生 paged KV 与连续批处理无缝接入 SGLang。128K 上下文下 H20 算子级较 FA3/4 对齐 dense 基线加速 17.5 倍（FP8 达 30 倍），端到端 TTFT 最高 4.83 倍，而 RULER/LongBench 精度损失不足 1.1 分，是「算法-内核-系统」三层协同落地的教科书级范例。</description></item><item><title>Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</guid><description>阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA（WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%）。核心论点是&amp;rsquo;对齐每一层&amp;rsquo;而非单点规模：结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹（仅用成功数据的SFT只能恢复8.5%的错误步骤）、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配，并发布双语真实网页基准BrowserBench（350任务均37.9步）。</description></item><item><title>从烧钱竞赛到精打细算：一个Token重度用户的Agent进化史</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-token-economy-agent-evolution-guigu101/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-token-economy-agent-evolution-guigu101/</guid><description>硅谷101对话黄东旭与张宏江：当Uber四个月烧穿全年AI预算、Meta给员工设token上限，&amp;ldquo;Token Maxing&amp;quot;的烧钱竞赛到达转折点。亲历者黄东旭讲述自己从日烧四五百美元的最强模型依赖，转向本地DeepSeek V4 Flash加云端Fable 5的混布组合；这场从token maxing到token efficient的转向，本质是模型能力跨过工程化门槛后，成本结构与企业KPI的重算。张宏江判断AGI奇点已至，而更深的分歧在于：单模型智商碾压与多agent蜂群，谁是终局。</description></item><item><title>UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-ui-mate-gui-agent-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-ui-mate-gui-agent-paper-reading/</guid><description>腾讯Hy Frontier Team发布UI-Mate——开源权重GUI基础Agent及配套训练栈：闭环数据引擎（任务生成→环境构建→rollout→过滤→能力分层均衡）驱动SFT+在线RL；交互侧用上下文示范解决“同一指令多次运行漂移”问题——OSWorkerBench提供33个同任务自示范与45个变体任务人录示范配对，附进度清单harness把示范转化为里程碑-子任务结构。OSWorld-Verified上UI-Mate-27B达77.0%超Kimi-K2.6（73.1%）与Qwen3.7-Plus（73.3%）、逼近Claude Opus 4.8（83.4%）；33任务自示范子集上单个示范使严格成功率17.2%→35.4%、进度67.9%→81.1%——示范把开放式意图消歧转化为对齐示例。</description></item><item><title>Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-intern-s2-mobius-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-intern-s2-mobius-paper-reading/</guid><description>Transformer的知识（FFN）与推理（Self-Attention）逐层绑定，模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构：全局共享的Memory（FFN知识向量库）+多个Reasoner（Self-Attention）以隐状态为载体反复查询知识库，原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU（1.6倍数据效率），Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31，端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链，并展望自进化、世界模型与软硬件协同四个延伸方向。</description></item><item><title>SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-simpleopd-tokenizer-distillation-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-simpleopd-tokenizer-distillation-paper-reading/</guid><description>把长上下文推理教师的能力蒸馏给异分词器短上下文学生，会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD：在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本，仅对占据完全相同文本跨度的token配对监督；配合终止token优势屏蔽+学生参考KL损失，截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2（+21.2分），超越Gemini-2.5-Pro，跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。</description></item><item><title>蒸馏风暴：门槛、灰色地带与一份没人愿意签字的竞赛规则</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-distillation-storm-late-talk/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-distillation-storm-late-talk/</guid><description>《晚点聊》编辑部红浩与曼奇复盘&amp;quot;蒸馏&amp;quot;这一没人愿意公开谈论的技术竞赛：典型蒸馏是有门槛的&amp;quot;抄答案&amp;quot;，含账号运营、数据管线、防中转站反被坑等系统工程；张一鸣为何禁止字节蒸馏——&amp;ldquo;只能逼近不能超越&amp;quot;加上组织激励代价；Anthropic如何用行为指纹识别2880万次&amp;quot;史上最大规模蒸馏攻击&amp;rdquo;；学生能否超越教师仍是开放问题；以及比蒸馏更大的问题——智能供需错配下&amp;quot;够用了&amp;quot;的模型正在改写定价逻辑。</description></item><item><title>Full-bandwidth transformer 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-16-full-bandwidth-transformer-paper-reading/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-16-full-bandwidth-transformer-paper-reading/</guid><description>Full-bandwidth transformer（微软+JHU+普林斯顿，含 John Langford）指出自回归 Transformer 的垂直反馈通道极窄：步间只回传一个采样 token（至多 log2|V| 比特），顶层隐状态被直接丢弃。论文提出潜反馈解码（latent feedback decoding），用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端，配合多 pass 训练目标、渐进调度与 prefix mixin，在 1B 模型 400B token 预训练中验证：Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降，每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。</description></item><item><title>从DeepSeek到Kimi K3，中国开源模型如何逼出黄仁勋的'开源联盟'</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</guid><description>DeepSeek V4 Pro登场，中国开源模型连续逼近前沿能力，迫使黄仁勋牵头组建美国&amp;quot;开放安全AI联盟&amp;quot;，Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI&amp;quot;开源&amp;quot;到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别，以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。</description></item><item><title>DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-dcas-scaffold-decoupling-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-dcas-scaffold-decoupling-paper-reading/</guid><description>深度精读华为加拿大软件卓越中心与女王大学的 DCAS 论文——首个系统揭示开源 CLI Agent 存在&amp;rsquo;scaffold 锁定&amp;rsquo;现象的工作。论文发现：在 OpenHands 单一 scaffold 下微调的模型，迁移到其他 scaffold 时性能可从 52.6% 暴跌至 8.4%。通过提出 DCAS 后端替换拦截层和区分显式/隐式规划两种形式，论文给出了一条从 scaffold 制品到模型能力的可行迁移路径，仅用 576 条规划感知轨迹即可让模型在非训练 scaffold 上一致提升。</description></item><item><title>「模型能力已经够了，要卷就卷 Infra」｜对话戴冠兰：从 Cloudflare 到 Runta，为十亿个 Agent 造执行底座</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-10-runta-agent-infra-daiguanlan/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-10-runta-agent-infra-daiguanlan/</guid><description>Runta 创始人戴冠兰（前 Cloudflare/Kong 核心）在十字路口播客中提出核心判断：模型能力爬坡已放缓，真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮（a16z 领投，Jeff Dean、李飞飞天使），定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力，让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。</description></item><item><title>特修斯之船：Kimi K3如何把Transformer的零件全部换掉，还能逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</guid><description>月之暗面K3是首个达到3T级别的开放权重模型，其47页技术报告揭示了一种&amp;quot;特修斯之船&amp;quot;式的架构哲学：注意力改成了线性+全局混合（KDA+MLA），残差变成了深度方向的Attention，FFN变成压缩空间的稀疏专家，甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3：线性注意力在2.8T规模上实现了6.3倍解码加速，Quantile Balancing路由是3T稳定训练的关键之一，MOPD让九个领域专家模型高效合板，而KDA（Kernel Development Agent）证明RSI已在kernel优化领域高速运转。核心判断：权重只是一次训练的产物，环境才是能反复产出下一代权重的护城河。</description></item><item><title>DiffusionGemma Technical Report 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-diffusiongemma-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-diffusiongemma-paper-reading/</guid><description>自回归（AR）LLM 逐 token 解码是根本瓶颈——DiffusionGemma 把语言模型生成从&amp;rsquo;逐 token 预测&amp;rsquo;改成'256 token 块并行精炼&amp;rsquo;。基于 Gemma 4 MoE（3.8B 激活/25.2B 总参）微调，两阶段训练（SFT 教双向去噪 + RL+采样器蒸馏提升质量与效率）用不到原 AR 模型 10% 的训练 token 预算，实现单张 H100 上约 1500 tokens/秒、约 20 tokens/forward pass，确立速度-能力新帕累托前沿。它仍保留 thinking mode、多模态、长上下文，且能 AR 生成，为混合扩散-AR 解码铺路。本文从&amp;rsquo;扩散模型并行精炼 vs AR 顺序解码&amp;rsquo;的第一性原理，解释为什么这条路能打破 AR 的固有瓶颈。</description></item><item><title>Infra 的浪漫与 AI 平权：盛颖从 SGLang 到 RadixArk</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</guid><description>SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk（1 亿美元种子轮）的完整路径。她提出 Infra 不应是 support 角色，而应成为产品本身；RadixArk 的使命不止于推理引擎，而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境，以及一位女性研究者在技术圈中的真实体验。</description></item><item><title>N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</guid><description>N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出，是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作（VTLA）基础模型。方法核心是三步训练配方：（1）在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验；（2）分阶段触觉通路集成，用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整；（3）ALTER——一种优势条件离线RL方法，将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务，在20任务仿真套件上平均成功率63.8%（最强baseline π0.5为44.0%），ALTER训练策略在3个长程真机任务上达到75-95%成功率。</description></item><item><title>何谓蒸馏？硅谷如何看中国开放模型逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</guid><description>月之暗面K3开源权重发布震动硅谷，开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了&amp;quot;蒸馏&amp;quot;争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击，以及开源模型安全之争的真正焦点。核心判断：没有开源，才是这个时代最不安全的事情。</description></item><item><title>GPU其实很闲：AI Infra四层架构与榨干硅极限的效率革命</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</guid><description>当AI行业的重心从训练转向推理，一个被忽视的事实浮出水面：GPU大多数时间其实很&amp;quot;闲&amp;quot;。Azure推理负载高达65%的能耗消耗在空转等待上，OpenAI的Chat类请求也达到52%。本文基于硅谷101播客，系统梳理AI Infra四层架构，拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术，把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。</description></item><item><title>一部昇腾史与全球芯片30年史诗——华为半导体首席科学家廖恒5小时深度访谈</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-25-huawei-liaoheng-ascend-chip-epic/</link><pubDate>Sat, 25 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-25-huawei-liaoheng-ascend-chip-epic/</guid><description>华为半导体首席科学家廖恒博士5小时深度访谈，从全球半导体30年兴衰史到昇腾芯片的断供求生之路。他以&amp;quot;十八层宝塔&amp;quot;重构芯片产业链全景，详解摩尔定律的三个方面（经济性已死、性能微弱、能效仍有），阐述昇腾与英伟达为何&amp;quot;越来越不像&amp;quot;，以及DeepSeek稀疏化设计与算力比的深层关联。这是华为在经历2020年磨难后，高管首次系统讲述昇腾史。</description></item><item><title>AI泡沫2027年爆破？两位投资人的硬核推演：中国开源模型、万亿债务与企业级决战</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-24-ai-bubble-2027/</link><pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-24-ai-bubble-2027/</guid><description>前百亿美金科技基金管理人Bill Tran与CSDN创始人蒋涛深度对谈AI泡沫问题。核心判断：2027年是危险年份，但不会出现L型熊市，而是多次flash crash快速重估；中国开源模型以1/10价格逼近美国闭源模型，将成为引爆泡沫的导火索；OpenAI万亿估值面临增长天花板，IPO后第三四个季度将迎来大考；AI相关债务到2029年将达7万亿美元，&amp;ldquo;增长能否解决一切&amp;quot;是终极命题；下一个决战在B端企业级市场和整机交付。</description></item><item><title>2026 Q2 AI季报：RSI从科幻走向创业赛道，Coding战场大洗牌，强者愈强的未来</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-22-ai-q2-review-rsi-coding/</link><pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-22-ai-q2-review-rsi-coding/</guid><description>2026年Q2 AI季报深度解读：Anthropic与OpenAI的模型竞争进入新阶段，GPT 5.6与Claude Maestro/Phable正面交锋；RSI（递归自进化）从科幻概念变成明确的创业方向，Recursive、Miranda等公司涌现；Cursor以600亿美元天价被收购；中国开源模型&amp;quot;四杀&amp;quot;引发全球关注；Anthropic的Cloud Tag与OpenAI的Record and Replay重新定义AI交互。本文基于播客全文转写整理，涵盖竞争格局、RSI、机器人、智能扩散、交互创新和公司动态。</description></item><item><title>从龙虾热到基金会治理：OpenClaw首席架构师Vincent Koc谈个人Agent的反思、工程化与协作未来</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-21-openclaw-vincent-koc/</link><pubDate>Tue, 21 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-21-openclaw-vincent-koc/</guid><description>2026 WAIC上海现场，OpenClaw Foundation首席架构师Vincent Koc深度复盘OpenClaw半年来的爆火与冷却、与中国市场的特殊关系、个人Agent与编程Agent的本质区别、基金会治理模式为何优于风投创业、以及他判断的下一个关键趋势——Agent之间的通信与协作。</description></item><item><title>走进中国AI实验室：Nathan Lambert的中美AI观察——开源领导权转移、算力困局与人才文化差异</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-03-nathan-lambert-china-ai-labs/</link><pubDate>Fri, 03 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-03-nathan-lambert-china-ai-labs/</guid><description>美国AI2实验室大模型负责人、开源AI领域最具影响力的研究者之一Nathan Lambert，2026年4月专程赴中国考察北京、杭州的AI实验室——阿里巴巴、智谱、月之暗面、清华、小米、美团、蚂蚁、零一万物等。回到美国后他写下了引发广泛讨论的文章。这期硅谷101播客中，Nathan分享了第一手观察：中国为何在大公司AI战略上走出了与美国截然不同的路线？开源模型领导权是否已经从美国转移到中国？华为芯片能否替代NVIDIA？中美AI人才和文化差异如何影响模型构建？本文从8大主题完整梳理，每个主题以&amp;quot;新的变化&amp;quot;+&amp;ldquo;嘉宾观点与解释&amp;quot;双维度展开，让没看过原视频的读者也能快速理解背后的推理逻辑。</description></item></channel></rss>