<?xml version="1.0" encoding="utf-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" version="2.0"><channel><title>玖捌肆贰</title><link>https://9842.cn/</link><description>玖捌肆贰AI集中营</description><item><title>华为云AI-Ready重构数据价值链，赋能智能体</title><link>https://9842.cn/?id=764</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/d57e2c7695c1985a361b41f52ddc6dfa.png&quot; alt=&quot;华为云AI-Ready重构数据价值链，赋能智能体&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;当大模型与Agent走进千行百业，数据的角色悄然逆转：从被动“被分析”，转向主动“被消费”。在数博会“从数据到Agent，数据价值链的重构与创新”主题活动上，华为云给出的答案是：以AI-Ready的数据基础设施，打通从数据管理、供给、使用到可信流通的全链路，让企业全量数据真正为AI与智能体所用。这不仅是技术堆栈的升级，更是数据价值链的重构。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;agent&quot;&gt;从“数据使用者”到“数据消费者”：Agent改变平台范式&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;智能体作为数据消费者的概念示意图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/562d5372bda8ae08f85d93d3a4a1c859.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;传统大数据平台主要为人和应用提供分析能力；而在Agentic时代，模型与智能体成为新型“数据消费者”，它们按任务连续摄取、生成、反馈数据，催生三大变化：&lt;br /&gt;
- 平台形态从单一湖仓走向多模态湖仓，既要承载文本、图像、语音、视频，也要纳入日志、时序、知识等多源异构数据。&lt;br /&gt;
- 数据组织从“报表导向”转向“任务导向”，强调低延迟、高吞吐、可追溯与可解释的实时供数。&lt;br /&gt;
- 治理对象从数据本身延伸到“数据-模型-Agent”闭环，数据质量、知识语义、行为策略与合规边界需协同治理。&lt;/p&gt;
&lt;p&gt;这意味着数据基础设施不再只是存储和计算的组合，而是要嵌入AI原生能力，面向训练与推理两条主路径，持续为智能体提供可用、可信、可演化的数据。&lt;/p&gt;
&lt;h3 id=&quot;ai-ready&quot;&gt;华为云AI-Ready全链路能力：让数据可管、可供、可用、可流通&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;AI-Ready数据基础设施全链路示意图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/040e26fa12a9f5d63fd6d6cb5270fd36.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;基于“混合云+Data+AI”战略与华为云Stack底座，华为云给出一套AI-Ready的数据基础设施方法论，核心在于四个链路级能力：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;可靠管数：以大数据引擎实现跨AZ、跨Region、跨云容灾，元数据亿级规模统一纳管；通过“存—算—管”三层解耦，保证数据可靠、可管、成本可控，成为AI可信的数据根基。&lt;/li&gt;
&lt;li&gt;高效供数：依托AI DataLake多模智能数据湖与三大核心引擎协同，直面“供数慢、体量小、精度低、适配弱”的行业痛点，面向模型训练与智能体推理双场景优化吞吐与延迟，让数据成为AI随取随用的“燃料”。&lt;/li&gt;
&lt;li&gt;智能用数：通过DataArts统一接入IT系统、OT生产、ET工程与KT企业知识，内置40余种处理算子，支持自演进本体与高性能计算，实现“Data→Logic→Action”的链路推进，数据无需搬移即可高效被AI理解与执行。&lt;/li&gt;
&lt;li&gt;可信流通：以隐私计算、数据API、数据沙箱与区块链构建可信共享环境，做到数据“可用不可见”“可证可控”，已在上海城市数据空间、南通家纺、云南交投等落地，打通多主体协作的信任缺口。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;本质上，这是把数据Ops、知识Ops与MLOps融合为“AgentOps”的底层支撑：既能让数据喂得上、吃得好，也能让智能体带着数据的语义和规则“走进业务”。&lt;/p&gt;
&lt;h3 id=&quot;_3&quot;&gt;行业样板：从治理到价值运营，路径愈发清晰&lt;/h3&gt;
&lt;p&gt;大会上，多家机构的实践展示了从“管好数据”到“让数据服务AI”的可行路径：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;设备制造：徐工以“智改数转网联”推动数据要素嵌入产品、制造与运营，治理不止于目录化与去孤岛，更强调为后续智能体决策打地基，体现“为用而治”的转变。&lt;/li&gt;
&lt;li&gt;能源电力：广东电网以“壹万万”多维标签体系结合“预标注+人工精标+多维标签”，在客服场景实现话术智能推荐日调用超2万次、准确率达98%，证明高质量数据集对推理效果的直接拉动。&lt;/li&gt;
&lt;li&gt;区域数据空间：长三角数链以“区块链+隐私计算”的“1+1+1+X”架构，已覆盖232个机构、140个场景，链上使用量达43亿笔，连通9省40市物流节点，验证跨域可信流通的工程可行性。&lt;/li&gt;
&lt;li&gt;数据价值运营：贵州数据宝提出“数据的终点不是报表，而是Token”，以“数据+算力+Token”三合一平台与独立路由的Token交易机制，日均调用达千亿级，并与华为形成“底座×运营”协同，探索数据确权、计价与结算的新范式。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些案例串起一条清晰路线：治理夯基—数据集提质—可信流通—价值运营—反哺AI与Agent，从而形成业务与智能的自增强循环。&lt;/p&gt;
&lt;h2 id=&quot;_4&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;AI-Ready数据基础设施的意义，不仅在于提升模型训练与推理效率，更在于重构数据价值链，让数据成为驱动智能体持续进化的生产力。对产业各方的启示包括：&lt;br /&gt;
- 对企业：尽快完成多模态数据底座与统一元数据/本体体系建设，把数据流、特征流与知识流产品化，纳入端到端的AgentOps。&lt;br /&gt;
- 对平台方：供数指标需同时关注吞吐、时延、精度与可追溯；将数据质量、知识对齐和安全合规前移到供给侧。&lt;br /&gt;
- 对生态与监管：数据主权、跨域合规与价值计量仍是关键挑战。面向“数据Token化”的探索要在可证与合规之间找到平衡，配合隐私计算与链上审计形成闭环标准。&lt;br /&gt;
- 对可持续性：AI与数据的计算成本上升，冷热分层、存算解耦与智能压缩将成为“算力×数据×能耗”的三角平衡抓手。&lt;/p&gt;
&lt;p&gt;从“Data到Agent”的路上，基础设施的AI原生化是底座，行业场景的工程化落地是抓手，数据价值的可信运营是飞轮。谁能先把这三件事打通，谁就能率先获得“数据—模型—Agent—业务”的复合增益。&lt;/p&gt;
&lt;p&gt;标签： &lt;code&gt;数据要素&lt;/code&gt; &lt;code&gt;AI-Ready&lt;/code&gt; &lt;code&gt;多模态湖仓&lt;/code&gt; &lt;code&gt;智能体Agent&lt;/code&gt; &lt;code&gt;隐私计算&lt;/code&gt;&lt;/p&gt;</description><pubDate>Sun, 30 Aug 2026 08:32:58 +0800</pubDate></item><item><title>港股AGI第一股：智能体与Token计费双轮增长</title><link>https://9842.cn/?id=763</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/21cb23ccf08ce0271aee441758ee46af.png&quot; alt=&quot;港股AGI第一股：智能体与Token计费双轮增长&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;消费级Agent热潮降温的同时，企业级智能化却在悄然加速。一家被称为“港股AGI第一股”的公司交出了一份颇具说服力的半年报：上半年营收5.62亿元，同比增幅接近四成；其中智能体（Agent）业务贡献了4.78亿元，占比超八成；更值得关注的是，Token计费的模型调用收入几乎从零起步，在第二季度环比暴涨超五倍，毛利率超过60%。这组数据的重要性不只在于增长，更在于清晰地展示了一条可复制的商业路径——从“进流程”的企业智能体，到“按调用计费”的模型能力，形成相互强化的双轮驱动。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;agent&quot;&gt;企业智能化服务：让Agent进流程、进平台、进系统&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;企业智能化三层架构与Agent进流程的概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/43eb79bea733540c920437a3bd81b90a.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;企业智能化服务是这家公司当前的基本盘，结构上可概括为“三段式”：&lt;br /&gt;
- 智能体应用：把Agent直接放进一线流程中干活；&lt;br /&gt;
- 智能体平台：把成熟能力沉淀为平台能力，扩展到区域与行业；&lt;br /&gt;
- 综合解决方案：把模型、数据与存量系统打通，完成复杂组织的系统级落地。&lt;/p&gt;
&lt;p&gt;这种“应用→平台→方案”的组合拳，核心在于将单点试点变成可规模化复制的能力网络。半年报显示，智能体业务营收4.78亿元，同比增长35.7%，背后是持续深入的场景化渗透：医疗领域已服务470余家机构（八成以上为三甲医院），在城市治理中完成52.44万家企业画像治理，在高端制造中帮助某新能源车企订单增长10%。一旦Agent进入核心流程，优化的不只是单个环节，而是整条业务链条，因而具备更强的复购和扩展潜力。&lt;/p&gt;
&lt;p&gt;这也解释了为什么同样是Agent，有的产品止步于“炫技”，而企业级路径能赚到真金白银——后者以结果为导向，强调流程改造、数据治理与系统集成，能在ROI上给出明确账本。&lt;/p&gt;
&lt;h3 id=&quot;token&quot;&gt;Token业务：从“模型调用费”走向可持续收入&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;Token按量计费与双轮驱动的概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/b219b2c483d599b82a52b0e6457aec7f.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;今年新增的Token业务，本质是通过公有云API提供大模型能力，客户按Token用量付费。上半年收入接近3000万元，同比增长约760%，其中Q2收入超过2500万元，环比增幅超500%，毛利率超过60%。这组陡峭的曲线背后，有两股力量正在合流：&lt;br /&gt;
- 供给侧：以自研大模型为核心的模型矩阵（如U2）达到了能够直接支撑生产场景的稳定性与性价比；&lt;br /&gt;
- 需求侧：企业对“按量付费”的模型调用方式接受度快速提升，从探索性试用转向业务化接入。&lt;/p&gt;
&lt;p&gt;值得注意的是，Token业务与Agent业务不是竞争关系，而是互为增益：Agent落地带来稳定用量，平台化能力降低集成门槛，API计费则把能力变成标准化商品。这种模式兼具“项目型收入的厚度”与“平台型收入的弹性”，为长期增长建立了第二曲线。&lt;/p&gt;
&lt;h3 id=&quot;_3&quot;&gt;增长质量：复购、现金流与交付能力&lt;/h3&gt;
&lt;p&gt;快增长更要看“增长质量”。半年报中，复购收入占比超过60%，现金流储备接近10亿元，客单价仍在抬升。背后有三点值得关注：&lt;br /&gt;
- 深度嵌入的护城河：一旦Agent进入核心流程，伴随业务扩展、数据回流与持续优化，客户粘性被结构性增强；&lt;br /&gt;
- 交付与运维的可复制性：平台化沉淀降低边际交付成本，方案化能力确保复杂系统的稳定上线；&lt;br /&gt;
- 成本结构的改善：Token毛利率超过60%，说明自研模型与推理基础设施正形成规模效应，为长期利润率留出空间。&lt;/p&gt;
&lt;p&gt;当然，也要看到约束与风险：Token体量虽小但增长陡峭，能否在保持毛利的同时进一步放大规模，取决于算力成本、模型效率、以及与行业场景的耦合深度。&lt;/p&gt;
&lt;h3 id=&quot;agent_1&quot;&gt;与消费级Agent的分水岭&lt;/h3&gt;
&lt;p&gt;过去一年，消费级Agent频频遭遇成本、稳定性与真实价值的拷问。企业级路径的不同在于：&lt;br /&gt;
- 价值锚定：以流程改造与KPI提升为目标，价值更可量化；&lt;br /&gt;
- 数据与合规：行业数据、隐私合规、系统可靠性是刚需，不是“可选项”；&lt;br /&gt;
- 交付闭环：从业务诊断、数据治理、到上线运维、持续优化，形成完整交付链。&lt;/p&gt;
&lt;p&gt;这是一条相对“重”的路，但正因重，护城河也更厚。&lt;/p&gt;
&lt;h2 id=&quot;_4&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;从产业视角看，这份财报提供了AGI商业化的一条可落地范式：以企业智能化为基本盘，辅以标准化API能力形成双轮驱动；以行业深耕获得复购和粘性，再以平台化扩散降低边际成本。对行业参与者的启示包括：&lt;br /&gt;
- 产品策略：优先攻坚可度量ROI的关键流程，建立“应用→平台→方案”的能力闭环；&lt;br /&gt;
- 技术策略：坚持模型工程与Agent工程双线并进，强化稳定性、可控性与可运维性；&lt;br /&gt;
- 商业模式：结合项目制与平台制，既吃下“重交付”的确定性，也拥抱“按量计费”的弹性；&lt;br /&gt;
- 风险管理：关注算力成本波动、模型同质化竞争、以及头部客户集中度，提前在海外与端侧新场景布局对冲。&lt;/p&gt;
&lt;p&gt;展望未来，企业级Agent与Token业务很可能进一步融合：更多流程被Agent化，更多能力以API输出，端侧AI与具身智能打开新的增量场景。若能在更多城市、更多行业复制“跑通一个场景、沉淀一套平台、打通一类系统”的路径，第二曲线将不只是“增长率漂亮”，而是“增长质量稳健”。对于正在寻找AGI商业化答案的市场来说，这或许就是一条值得追随的路线。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;AGI&lt;/code&gt; &lt;code&gt;智能体&lt;/code&gt; &lt;code&gt;企业服务&lt;/code&gt; &lt;code&gt;大模型&lt;/code&gt; &lt;code&gt;云知声&lt;/code&gt;&lt;/p&gt;</description><pubDate>Sat, 29 Aug 2026 14:38:22 +0800</pubDate></item><item><title>Sora为何输给Codex：关键在GPU时间复用</title><link>https://9842.cn/?id=762</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/e85a1b768d60c121d8b2c44027722197.png&quot; alt=&quot;Sora为何输给Codex：关键在GPU时间复用&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;同样是烧 GPU 的大户，为何视频生成 Sora 会在资源倾斜上输给代码智能体 Codex？答案不在于“谁更费卡”，而在于工作负载的形态能否把 GPU 时间切成可复用的碎片。Sora 的算力路径连贯、独占、难以拆分；Codex 的算力路径碎片化、可调度、易于复用。当产品扩张进入“机房物理学”决定上限的阶段，谁能更好地复用 GPU 时间，谁就能更快跑。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;sora&quot;&gt;Sora 的难点：连续、独占、难以切片&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;视频扩散任务连续占用GPU的概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/9649c455098f96eb11bfefbce3639454.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;视频扩展在模型内部是“三维长出来”的：时间、宽度、高度同步推高视觉 token 数。即便经过压缩和 patch 化，N 依然近似随 T×H×W 增长。再叠加扩散式采样带来的多轮迭代，单条视频的总计算量更像 D 次“全画幅重渲”，每一轮都要对整块时空 latent 进行更新。&lt;/p&gt;
&lt;p&gt;与语言模型生成可通过 KV cache 复用既有历史不同，视频扩散每个采样步之后主体 latent 已变化，下一轮面对的是新的状态，历史复用的空间极小。结果是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;单次任务长：一步接一步，写满整个生成时长，几乎没有可让位的间隙。&lt;/li&gt;
&lt;li&gt;占用连续：显存、带宽和 Tensor Core 长时间被同一条视频独占。&lt;/li&gt;
&lt;li&gt;形状多样：不同分辨率、帧长、纵横比造成 tensor shape 不一致，服务端需要分桶配对，批处理难以“凑满”且增加排队时间。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此，即便 GPU 利用率曲线漂亮（芯片几乎无闲置），单位时间内交付的“请求数”也未必高。因为每条请求消耗的 GPU-seconds 太重，吞吐被单条路径“绑住”。这也是视频生成难以通过“调度魔法”把算力摊给更多并发用户的核心原因。&lt;/p&gt;
&lt;h3 id=&quot;codex&quot;&gt;Codex 的优势：碎片、可复用、易于调度&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;代码智能体碎片化复用GPU时间的概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/330b4285c812d33e6d8b8277f235d927.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;代码智能体的链路同样费卡，但形态更友好于复用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;序列可缓存：LLM 推理的 KV cache 允许保留历史上下文，后续 decode 不必重算整段历史。&lt;/li&gt;
&lt;li&gt;连续批处理：不同会话在 prefill/decode 阶段可交错进入同一 batch，GPU 上的 token 流被“拼接”成更厚的矩阵计算。&lt;/li&gt;
&lt;li&gt;工具等待释放 GPU：调用编译、测试、运行器或 IDE API 时，大量时间在 CPU/IO/外部执行，GPU 可立刻让位给其他用户的 decode。&lt;/li&gt;
&lt;li&gt;可切可续：一次对话天然由许多短推理片段构成，调度器可以在片段边界“插队”或“补位”，把空隙塞满。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这意味着相同的 GPU 集群中，Codex 可以通过时间片与缓存复用，把昂贵的矩阵运算均摊至更多并发任务。即便单个工作流持续几十分钟，GPU 真正在忙的时段被切成许多短片段，也就具备了把“碎片时间”卖给更多用户的能力。&lt;/p&gt;
&lt;h3 id=&quot;gpu&quot;&gt;本质差异：GPU 时间是否可复用&lt;/h3&gt;
&lt;p&gt;将二者对比，可归纳为一条朴素但关键的工程定律：同样的算力预算，谁能把 GPU 时间切成更多可插拔的时间片，谁就更能提升并发、降低单请求成本、加快产品扩张。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Sora：时间片大且连续，形状异构，批不易拼，历史不可复用，难被预empt。&lt;/li&gt;
&lt;li&gt;Codex：时间片小且可交错，形状相对统一（token 序列），历史可缓存，易被调度。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这不是“绝对消耗”的胜负，而是“工作负载架构”的胜负。最终体现在产品层面，就是单位算力可服务的用户数差距，从而决定了优先级的倾斜。&lt;/p&gt;
&lt;h2 id=&quot;_3&quot;&gt;影响与展望&lt;/h2&gt;
&lt;h3 id=&quot;_4&quot;&gt;对产品与商业的影响&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;扩张速度：可复用的 GPU 时间等价于更高的并发与更短的排队；这直接转化为更快的用户增长与留存。&lt;/li&gt;
&lt;li&gt;单位成本：视频生成的 GPU-seconds 更难摊薄，价格体系更难下探；Coding Agent 则可通过增量缓存、智能调度、工具外包，持续压低边际成本。&lt;/li&gt;
&lt;li&gt;体验优化：交互式产品（代码助理）天然受益于“低延迟+高并发”的调度；视频生成则更像重渲任务，易被稳定性、时延、成本三者的三角关系束缚。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;_5&quot;&gt;视频方向的改进路径&lt;/h3&gt;
&lt;p&gt;要让视频生成更“可复用”，需要从模型、采样、服务三层共振改造：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;模型层&lt;/li&gt;
&lt;li&gt;分层/分辨率递进：先粗后细的两阶段或多级扩散，将早期阶段做小做快，后期精修按需开启。&lt;/li&gt;
&lt;li&gt;稀疏化与 ROI：引入稀疏注意力或区域级更新，对变化区域优先计算，减少全局重算。&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;低步数蒸馏与新采样：通过蒸馏、流匹配等缩短采样步数 D，降低“每条任务的连续长度”。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;采样层&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;可中断与检查点：将长采样切段化，支持保存/恢复，便于调度器在步间插队。&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;质量自适应：根据运动复杂度、画面细节动态分配步数，为简单片段削峰填谷。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;服务层&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;形状标准化：以模板化的时长/分辨率为主线，减少 shape 异构度，提升 batch 命中率。&lt;/li&gt;
&lt;li&gt;连续调度：引入 prefill/decode 类似的“阶段化调度”，例如将某些后处理、上采样迁至异构硬件或离线阶段。&lt;/li&gt;
&lt;li&gt;资源切片：利用 MIG 或多租户策略对显存和算力隔离，配合队列优先级与 SLA 保障，降低大任务对全局并发的阻塞。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些改动的共同目标，是把一条“长、重、难插队”的生成路径，改造为“短、段、可预empt”的可调度工作负载，从而让视频也能享受到 GPU 时间复用的红利。&lt;/p&gt;
&lt;h3 id=&quot;coding-agent&quot;&gt;Coding Agent 的下一步&lt;/h3&gt;
&lt;p&gt;代码智能体虽然在调度侧具备天然优势，但也并非“不要钱”。随着自动测试与工具链变深，后台算力需求同样攀升。其优化方向将更多落在系统层与工程实践上：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;强化 KV 复用与跨会话缓存，减少重复计算；&lt;/li&gt;
&lt;li&gt;提前索引/静态分析，转移一部分推理负担；&lt;/li&gt;
&lt;li&gt;提升工具链吞吐，缩短“等待段”，进一步释放 GPU；&lt;/li&gt;
&lt;li&gt;对长会话引入预算与配额，避免算力被少数任务占满。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;当系统化治理做到位，Coding Agent 的单位成本还会继续向下走，从而巩固其在“算力可复用”维度上的优势。&lt;/p&gt;
&lt;h2 id=&quot;_6&quot;&gt;小结&lt;/h2&gt;
&lt;p&gt;Sora 与 Codex 的胜负不是模型好坏之争，而是工作负载架构的较量。可复用的 GPU 时间，正在成为 AI 产品扩张的第一性因素。谁能把“重任务”拆成可被调度器高效拼装的时间片，谁就更有机会在同样的机房里服务更多用户、迭代更快、走得更远。视频生成若要重回赛道核心，关键在于让“连续、独占”的计算变得“可切、可续、可拼”，把算力从单条路径里解放出来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;Sora&lt;/code&gt; &lt;code&gt;Codex&lt;/code&gt; &lt;code&gt;GPU调度&lt;/code&gt; &lt;code&gt;视频生成&lt;/code&gt; &lt;code&gt;Coding Agent&lt;/code&gt;&lt;/p&gt;</description><pubDate>Sat, 29 Aug 2026 14:33:43 +0800</pubDate></item><item><title>深度拆解 Muse Glimmer，24GB 显存跑 30B Agent，Meta 到底做了什么？</title><link>https://9842.cn/?id=761</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/7d30a181b7658b8c185c0973854a997f.png&quot; alt=&quot;深度拆解 Muse Glimmer，24GB 显存跑 30B Agent，Meta 到底做了什么？&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;Meta 推出的 Muse Glimmer，并不是再造一个“大模型聊得更好”的故事，而是直指本地长时运行的 Agent：在一张 24GB 显存的显卡上，处理屏幕、图片、工具与代码执行，且维持 128K 上下文的稳定推理。它的“亮点”不是单点性能，而是把一堆看似边角的工程难题拼成了可落地的系统解。表面上是 30B 多模态模型，背后是对本地 Agent 运行范式的系统性重构。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;24gb-30b&quot;&gt;24GB 跑 30B：长上下文的工程答案&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;长上下文与分层注意力的概念示意&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/562c298dfb4c2cf01b263a7ee8d5904d.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;要在有限显存里塞下 128K 上下文，Muse Glimmer走的是“精打细算”的路径，而非堆料提频。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;结构取舍：52 层 Dense Transformer，Hidden Size 6656，32 个 Query Head 但仅 2 个 KV Head。本质是 GQA（Grouped-Query Attention）的激进版，用更少的 KV 通道服务更多的查询，直接削减 KV Cache 的体积。&lt;/li&gt;
&lt;li&gt;分层注意力：三层 Local Attention 接一层 Global Attention 的循环。Local 层只看滑动窗口（约 2048 token），Global 层负责长距离信息交换。这样设计把“必须长期保留的 KV”集中在少数层，大幅压缩长上下文成本。&lt;/li&gt;
&lt;li&gt;显存账本：按 BF16 粗估，若 52 层都保留 128K KV，Cache 需约 6.5 GiB；采用“39 层 Local + 13 层 Global”后，需常驻长上下文的只有 Global 层，KV Cache 下降至约 1.7 GiB 量级。这个数不是官方指标，但可解释为何结构要如此布局。&lt;/li&gt;
&lt;li&gt;取舍代价：长距离信息传递“分段进行”，信息在 Local 段内延迟到下一次 Global 层才扩散。这换来显存可控与连续运行，也意味着模型在极长距离依赖上的即时敏感度，更多依赖 Global 层的布局与训练调校。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这套组合拳的核心逻辑是：把“上下文长期驻留”的成本集中优化，让 128K 真正可在工作站级 GPU 上维持运行，而不仅是“偶尔能跑起来”的实验状态。&lt;/p&gt;
&lt;h3 id=&quot;_3&quot;&gt;量化与组件拆分：把空间留给工作流&lt;/h3&gt;
&lt;p&gt;长时 Agent 的瓶颈不只在 KV Cache，权重与多模态组件同样“吃紧”。Muse Glimmer提供两套 4bit 量化路线，并把视觉模块与推理加速部件拆分管理：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;K-Quant 路线：主干权重约 16.8GB，配合独立视觉编码器约 1.4GB、DFlash 约 1.6GB，总体接近 20GB。此方案目标直指 24GB 显存的边界设备。&lt;/li&gt;
&lt;li&gt;Dynamic K-Quant 路线：总量约 20GB，但在运行态需要更宽裕的余量（中间态缓冲、KV 管理、视觉缓存），更适合 32GB 设备。&lt;/li&gt;
&lt;li&gt;独立视觉编码器：将视觉感知从语言主干解耦，利于复用已编码的图像/屏幕特征，减少重复吞吐，尤其适合“每步都有截图”的桌面/移动端操作任务。&lt;/li&gt;
&lt;li&gt;本地部署生态：llama.cpp、MLX、ExecuTorch 等路径意味着 CPU、Apple Silicon 与移动端都可进入“可用而非演示”的状态，这对本地 Agent 的普及是关键设施。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;量化不是“压到越小越好”，而是在权重精度、运行时缓存、视觉特征驻留之间找平衡，让预算显存尽可能多地留给真实任务流。&lt;/p&gt;
&lt;h3 id=&quot;dflash&quot;&gt;DFlash 与解码路径：把算力用在刀刃上&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;持续解码加速与KV管理的概念示意&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/5139c3012105e5976578b2aeea6536bf.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;官方声称的 3.1 倍推理加速，核心在“Decode 路径”的极致优化。长时 Agent 的瓶颈并非 Prefill，而是长链条 Reasoning 的持续解码。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;解码优先：在 128K 下，Prefill 的吞吐优化不再是全部，持续 Decode 的内核优化、KV 读写策略、批次并行更关键。&lt;/li&gt;
&lt;li&gt;KV 管理与稀疏化：配合前述 Local/Global 的层级设计，DFlash 对 KV 的存取、分页与复用做了工程级整合，避免把带宽浪费在“不必要的长距离访问”上。&lt;/li&gt;
&lt;li&gt;工程结果：当工具结果与日志不断追加，Decode 成本容易被“冗长的 Reasoning Token”拉爆。加速的意义在于，把同样的算力预算转化为更长的可持续对话链条，而不是短期峰值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;本质上，DFlash 让“长任务的持续解码”成为优化目标，从而匹配本地 Agent 的真实负载画像。&lt;/p&gt;
&lt;h3 id=&quot;_4&quot;&gt;视觉与工具：为“屏幕原生”而生&lt;/h3&gt;
&lt;p&gt;Muse Glimmer 的定位，不是通用聊天模型，而是“屏幕与工具原生”的本地 Agent：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;屏幕理解：独立视觉编码器支撑对图片/屏幕的高频处理，结合 128K 上下文保存页面状态与工具回执，使模型能跨数十步维持任务一致性。&lt;/li&gt;
&lt;li&gt;工具与执行：支持工具调用与代码执行，适应“失败-重试-修正”的真实工作流。长上下文允许保留细粒度日志，但也会放大冗余信息；Muse Glimmer 借助结构化上下文与层级注意力，抑制“信息洪水”拖垮 Decode。&lt;/li&gt;
&lt;li&gt;30B 的选择：相较更大的模型，30B 在通用推理、工具调用与多模态理解上达到“够用”与“可部署”的平衡点，是面向 24GB 硬件的现实权衡。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这是一套“为任务而配”的模型，而非把 Chat 场景的设计硬搬到本地长任务。&lt;/p&gt;
&lt;h2 id=&quot;_5&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;Muse Glimmer 的价值不在“参数与上下文堆得多高”，而在于从注意力结构、KV 管理、量化与解码路径的全链路重排，给本地 Agent 立了一条可复制的工程路线：在单卡 24GB 上连续运行、有工具、有视觉、有长上下文。&lt;/p&gt;
&lt;p&gt;短期影响：&lt;br /&gt;
- 工作站级设备的本地 Agent 将更可用，企业可在合规场景下把敏感工作流留在本地执行。&lt;br /&gt;
- 开源生态会围绕 GQA+层级注意力、可分离视觉与 DFlash 类解码加速，形成新的“默认堆栈”。&lt;/p&gt;
&lt;p&gt;中期展望：&lt;br /&gt;
- 记忆与上下文管理将继续演进：从长上下文硬撑，走向层级记忆、摘要与检索的协同；把“重要状态”固化为结构化存证，减少纯文本冗余。&lt;br /&gt;
- 推理路径将更“任务态”：把工具调用、代码执行与模型解码耦合成统一调度，按工作流而非 token 产出优化吞吐。&lt;br /&gt;
- 评测范式会更新：从对话基准转向“长任务稳定性、工具鲁棒性、屏幕操作可靠性”的端到端指标。&lt;/p&gt;
&lt;p&gt;如果说此前的本地模型只是“能跑”，Muse Glimmer 代表的是“能跑在真正的任务上”。在本地智能体的时代，这或许比一次性的高分 benchmark 更重要。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;本地Agent&lt;/code&gt; &lt;code&gt;长上下文&lt;/code&gt; &lt;code&gt;推理加速&lt;/code&gt; &lt;code&gt;多模态模型&lt;/code&gt;&lt;/p&gt;</description><pubDate>Sat, 29 Aug 2026 08:33:26 +0800</pubDate></item><item><title>有道AI耳机OpenPods：iPhone同传助手</title><link>https://9842.cn/?id=760</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/7a6b96977df9e4278b876667c5beb7f5.png&quot; alt=&quot;有道AI耳机OpenPods：iPhone同传助手&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;语音，正成为下一代个人生产力的入口。8月27日，网易有道发布OpenPods有道AI耳机，定位为“专为iPhone用户打造的Agent耳机”。它不只是把录音、转写和翻译塞进耳机，而是把“采集—理解—整理—调用”做成一条可落地的完整工作流，让声音从即时信息变成可复用的知识资产。这类产品的出现，意味着AI从“对话框里的助理”走向“在场的助手”。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;_3&quot;&gt;硬件与系统协同：把声音采集的最后一公里补齐&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;耳机、耳机舱与手机协同采集声音的示意图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/53637a55ec65ac81ea041a0acaf5cc49.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;传统的语音工具常常割裂：录音在一个应用，转写在另一个，翻译又在第三个，关键内容在切换间就被“漏掉”了。OpenPods的思路是用硬件和系统级能力把入口做得足够顺滑。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;基于苹果MFi认证与系统级接入，线上通话/音视频会议中，按下耳机实体键即可开始录音，无需解锁手机、无提示音干扰，锁屏可用，减少错过要点的风险。&lt;/li&gt;
&lt;li&gt;面向线下场景，独立的智能耳机舱内置麦克风、扬声器和存储模块：放在桌面可录制多人对话，双击即可外放中英互译，临时化身为口袋翻译机。&lt;/li&gt;
&lt;li&gt;耳机、耳机舱与iPhone应用三端协同，覆盖从远程会议到访谈、培训、路演的全链路声音采集，尽量把“按下一个键就开始记录”的操作压到最低成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这类“协同硬件”的价值，不在于单点指标有多强，而在于让用户几乎不需要切换心智：想记录时直接按键，结束后自动进入理解与整理阶段。对于依赖口头沟通的职场人，这是效率的关键杠杆。&lt;/p&gt;
&lt;h3 id=&quot;_4&quot;&gt;同传走进日常：各说母语也能顺畅交流&lt;/h3&gt;
&lt;p&gt;跨语言沟通往往卡在“你说—我等—看字幕—再说”的节奏里。OpenPods试图通过双向同传把节奏打通：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;跨国通话时，中文与英文可双向互译，对方无需安装应用或额外设备；面对面交流可两人各戴一只耳机，各说母语边聊边译。&lt;/li&gt;
&lt;li&gt;观看无字幕的外语直播、演讲或课程时，可生成近实时双语字幕，减少理解延迟。&lt;/li&gt;
&lt;li&gt;译音可通过音色克隆技术尽量贴近原声，在效率之外保留表达的“个人色彩”。&lt;/li&gt;
&lt;li&gt;当前支持20余种语言及部分方言（如粤语、上海话），并通过OTA持续扩展。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;值得注意的是，实时同传的体验取决于三个要素：语音识别在嘈杂环境下的鲁棒性、机器翻译对领域术语的掌握、以及合成语音的延迟控制。开放式佩戴加上算法降噪可提升拾音，但在复杂噪声与多说话人重叠场景仍需要算法持续迭代。实际使用中，建议给关键结论留出复述确认的“缓冲”，确保沟通准确性与合规性。&lt;/p&gt;
&lt;h3 id=&quot;ai-agent&quot;&gt;从“记下来”到“做出来”：AI Agent接管声音工作流&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;语音转为纪要、待办与知识库的AI流程示意&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/42410b7c6ee9011d4c4095afaa161653.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;真正的变化发生在录音结束之后。OpenPods将语音交给AI Agent，自动完成从文字化到结构化的全过程：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;转写与理解：区分发言人，识别并校正专业术语，生成结构化会议纪要、待办事项与思维导图。&lt;/li&gt;
&lt;li&gt;可追溯问答：通过“Ask AI”对录音内容发问，回答附带音频来源与逐句定位，便于核验与溯源。&lt;/li&gt;
&lt;li&gt;一键执行：总结、写邮件、翻译等常见指令可直接运行，减少在多个应用间搬运信息的时间。&lt;/li&gt;
&lt;li&gt;知识沉淀：录音与文稿自动归档为个人知识库，按项目/客户持续积累，后续可检索、复用与跨文档聚合。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;和传统“录音转文字”不同，这里有两个进步：一是产出格式从原始文本跃迁到结构化、可执行的任务；二是建立了“语音—文档—知识库”的可回溯关系，既能追源也能复用。这正是“Agent化”的要义：不只回答问题，更要推动动作。&lt;/p&gt;
&lt;h3 id=&quot;ai7&quot;&gt;形态与续航：把AI塞进7克的日常佩戴&lt;/h3&gt;
&lt;p&gt;硬件层面采用开放式轻盈设计，单只约7克；智能降噪辅助清晰拾音；综合续航最长可达32小时，支持全天候移动办公。配色提供黑白两种。产品已开启预售，计划于9月10日正式发售。&lt;/p&gt;
&lt;p&gt;“先做iPhone”的选择，背后是对接MFi生态与系统能力的现实考量：在通话与系统音频路径、低延迟链路与权限管理上，深度协同能显著降低交互摩擦。未来若扩展至Android，需要在碎片化的系统版本与权限上做额外适配。&lt;/p&gt;
&lt;h2 id=&quot;_5&quot;&gt;影响与展望&lt;/h2&gt;
&lt;h3 id=&quot;ai&quot;&gt;对AI终端的启示：从语音入口到事件驱动&lt;/h3&gt;
&lt;p&gt;过去的智能耳机强调音质、降噪与语音唤醒，如今“Agent耳机”把重点转向工作流编排。按键即录、自动理解、结果回填任务系统，这是典型的事件驱动与长记忆形态。耳机和智能耳机舱像是身边的“感知节点”，把现实世界的语音事件流不断送入个人知识图谱。&lt;/p&gt;
&lt;h3 id=&quot;_6&quot;&gt;对职场效率的重塑：减少信息损耗与重复劳动&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;会议环节：从会中捕获要点，到会后自动生成纪要、待办与跟进邮件，可显著缩短“会后两小时”的整理时间。&lt;/li&gt;
&lt;li&gt;跨语协作：同传降低等候与复述成本，让远程跨国协作的节奏更接近母语沟通。&lt;/li&gt;
&lt;li&gt;内容生产：采访、播客、课程笔记与复盘的门槛降低，音视频内容能更快转化为可检索的文本与知识卡片。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;_7&quot;&gt;风险与边界：隐私、合规与可控性&lt;/h3&gt;
&lt;p&gt;声音是高度敏感的数据。实际部署中需要关注：&lt;br /&gt;
- 录音合规：各地区对通话与现场录音有不同的同意要求，建议产品提供显性提示与便捷的共享知情机制。&lt;br /&gt;
- 数据安全：端云协同时的加密、最小化上传与可删除能力，是企业与个人用户都会问的底线。&lt;br /&gt;
- 身份与音色：音色克隆提高亲和力，但也需建立明确的使用边界，防止被用于冒名或深度伪造。&lt;br /&gt;
- 准确性与责任：自动转写与总结难免有误差，关键决策场景应保留人工校对与版本追踪。&lt;/p&gt;
&lt;h3 id=&quot;_8&quot;&gt;下一步的想象空间&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;更低时延与更强端侧：端侧ASR/MT/TTS与小型化专用芯片可在弱网下保持可用，并降低隐私风险。&lt;/li&gt;
&lt;li&gt;多模态融合：把PPT、白板、桌面共享与语音一起理解，自动生成更贴合上下文的纪要与行动项。&lt;/li&gt;
&lt;li&gt;与业务系统打通：对接日历、CRM、项目管理工具，实现从“记录”到“立刻创建任务/回填客户档案”的闭环。&lt;/li&gt;
&lt;li&gt;生态扩展：Android版本、开放SDK与第三方插件，决定了Agent耳机能否成为“个人口语操作系统”的通用入口。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;把AI装进一副7克的耳机，看似是硬件的进化，实则是工作方式的改变：让人从回忆和重复劳动中解放出来，把注意力留给交流与决策。声音如果能被可靠捕获、准确理解并高效执行，确实有机会变成新的生产力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;AI硬件&lt;/code&gt; &lt;code&gt;智能耳机&lt;/code&gt; &lt;code&gt;AI Agent&lt;/code&gt; &lt;code&gt;实时翻译&lt;/code&gt; &lt;code&gt;语音生产力&lt;/code&gt;&lt;/p&gt;</description><pubDate>Fri, 28 Aug 2026 14:37:04 +0800</pubDate></item><item><title>GLM-5.3-Flash低成本多模态突围</title><link>https://9842.cn/?id=759</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/cdbd32cb1acec46ec3d380975122d3f1.png&quot; alt=&quot;GLM-5.3-Flash低成本多模态突围&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;GLM-5.3-Flash 的上线与开源，不只是又一则模型榜单新闻。更有意义的是，它把“原生多模态 + 极低成本架构”的技术方向与“国产异构大规模商用”的基础设施能力绑定在一起：前者追求以更少算力实现更强性能，后者让这种性能真正以可负担的 Token 形式大规模供给。二者合流，意味着前沿智能从“能做”走向“能用、能负担、能规模化”。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;glm-53-flash&quot;&gt;GLM-5.3-Flash：原生多模态与“低成本即设计目标”&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;原生多模态与稀疏激活的示意图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/af8a1fd23d374c48bc4b91b509b32791.png&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;关键参数与能力区间&lt;/li&gt;
&lt;li&gt;总参数 320B，A18B 表示每个 Token 实际激活约 180 亿参数，典型 MoE 思路兼顾容量与成本。&lt;/li&gt;
&lt;li&gt;在 AA 综合智能指数中得分 57，步入全球前沿区间，与 Claude Opus 4.8 持平。&lt;/li&gt;
&lt;li&gt;性能与数据基础&lt;/li&gt;
&lt;li&gt;借助 30T 级多模态预训练语料，训练侧更贴近真实应用分布，推理侧更“稳态”。&lt;/li&gt;
&lt;li&gt;“Flash”命名指向吞吐与时延优化，尤其适合长上下文与流式多模态服务。&lt;/li&gt;
&lt;li&gt;低成本来自架构内生化&lt;/li&gt;
&lt;li&gt;MoE 的稀疏激活让单次推理的有效计算收敛在 A18B 量级。&lt;/li&gt;
&lt;li&gt;多模态统一编码减少跨模态适配损耗，为异构推理调度创造更清晰的带宽/算力边界。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;token&quot;&gt;“一套模型 + 一座 Token 工厂 + 一套智能体管控”如何把智能规模化&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;异构算力驱动的 Token 工厂概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/9c3d06d56cf6fbce59003ac4a93cf44e.png&quot; /&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Token 工厂的本质：把算力、数据与能源变成“Token 产能”&lt;/li&gt;
&lt;li&gt;跨不同芯片/集群/能源与交付节点的编排，围绕“成本/时延/能耗”三目标持续优化。&lt;/li&gt;
&lt;li&gt;与模型形成双向闭环：模型侧暴露可观测指标，工厂侧据此做算子、并行度与缓存策略调参。&lt;/li&gt;
&lt;li&gt;可度量的基础设施：TPW 成为新标尺&lt;/li&gt;
&lt;li&gt;商汤大装置引入算电协同 Agent，以 Tokens Per Watt（TPW）衡量能效，和传统“每卡性能”不同，它更贴近服务成本与碳足迹。&lt;/li&gt;
&lt;li&gt;数据侧与规模化供给&lt;/li&gt;
&lt;li&gt;7 月日均 Token 服务量达 2.42 万亿，预计 2026 年底突破日均 10 万亿；这意味着从“峰值示范”走向“稳定供给”。&lt;/li&gt;
&lt;li&gt;异构混推把不同阶段的计算/带宽需求映射到最合适的国产芯片：整机性价比达到 NVIDIA H 系列的 1.25 倍；相较国产同构推理，同等成本下 Token 产能放大约 2.5 倍。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;62t&quot;&gt;实证数据：62T 调用与国产算力的“正名时刻”&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;上线前以匿名 Ox-Alpha（中文社区称“牛来”）在 OpenCode、OpenRouter 进行大规模实测，累计 Token 调用达 62T，全部由国产芯片承载。&lt;/li&gt;
&lt;li&gt;相比同一硬件环境的初始基线，端到端服务性能提升 3 倍；硬件效率与单 Token 成本与主流英伟达 GPU 相当。&lt;/li&gt;
&lt;li&gt;结论不再停留于实验室：国产算力已能在真实、持续的大流量中承接前沿大模型的推理负载，这对供给安全、成本可控与生态独立性意义重大。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&quot;_3&quot;&gt;影响与展望&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;对应用侧的直接影响&lt;/li&gt;
&lt;li&gt;原生多模态能力下沉，长视频理解、多表单与图文检索、流式语音助手等场景可在更低成本门槛上落地。&lt;/li&gt;
&lt;li&gt;中小企业可“按 Token 取用”，从拼显卡转向拼业务设计与数据积累。&lt;/li&gt;
&lt;li&gt;对基础设施的产业化启示&lt;/li&gt;
&lt;li&gt;Token 将日益像“电力”一样被度量、定价与调度，TPW 成为 AIDC 的通用效率语言，推动绿色 AI 与算电协同。&lt;/li&gt;
&lt;li&gt;“异构即默认”的时代来临：单卡极限的重要性下降，系统级编排、算子库标准化、自动并行编译器成为护城河。&lt;/li&gt;
&lt;li&gt;技术与生态的待解难题&lt;/li&gt;
&lt;li&gt;异构带来的软件复杂度上升：跨芯片编译与内核适配、跨集群一致性与容错、跨地域的算电协同调度仍需工程化打磨。&lt;/li&gt;
&lt;li&gt;多模态评测与安全对齐：AA 指标提供横向参考，但数据安全、内容可信与跨模态对齐将成为下一阶段的竞争焦点。&lt;/li&gt;
&lt;li&gt;中期展望&lt;/li&gt;
&lt;li&gt;国产异构与原生多模态的“双轮驱动”有望在 2026-2027 年催生“百亿级日均 Token”的区域节点，形成可与国际一线比肩的低成本供给范式。&lt;/li&gt;
&lt;li&gt;竞争重心从“模型颗粒性能”转向“端到端供给能力”：谁能以更高 TPW、更低延迟、更稳定的 Token 服务支撑复杂 Agent 编排，谁就更接近真正的 AI 基础设施领跑者。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;标签： &lt;code&gt;国产算力&lt;/code&gt; &lt;code&gt;多模态大模型&lt;/code&gt; &lt;code&gt;异构推理&lt;/code&gt; &lt;code&gt;Token工厂&lt;/code&gt; &lt;code&gt;TPW&lt;/code&gt;&lt;/p&gt;</description><pubDate>Fri, 28 Aug 2026 14:33:42 +0800</pubDate></item><item><title>阿里发布Qoder：任务优先的智能体工作台</title><link>https://9842.cn/?id=758</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/83078545534f5b156da90796207fe1e6.png&quot; alt=&quot;阿里发布Qoder：任务优先的智能体工作台&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;阿里推出全新 Qoder，将“以 Coding 为核心能力的智能体工作台”这一定位进一步落地。与传统“先写代码、再拼接工具”的流程不同，它把任务与目标放在前面，用户用自然语言说清想达成的结果，系统再调用编程与工具链去实现。从开发与原型，到数据处理与自动化运维，一套工作台承接端到端交付，意在缩短“从想法到产物”的路径。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;_3&quot;&gt;任务为先：双模式与更轻的入口&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;任务为先的双模式流程概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/624bc1e7eae17651ff91666da92989a0.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;全新界面强调“任务中心”，而非“代码编辑器中心”。用户不用从空白文件开始，而是先描述目标、约束与验收标准，智能体据此制定方案并执行。为覆盖更广人群与场景，提供两种模式：&lt;br /&gt;
- 编程模式：偏向开发者，擅长读代码、改代码、写测试、提 PR、对接 CI/CD。&lt;br /&gt;
- 通用模式：面向更广泛用户，聚焦数据处理、内容生成、表单与流程自动化等，无需直面代码也能调用编程与工具能力。&lt;br /&gt;
在交互上，系统支持对话式澄清、阶段性检查点与可视化任务结构，减少反复重述指令的摩擦，帮助非技术用户也能“驱动代码完成工作”。&lt;/p&gt;
&lt;h3 id=&quot;_4&quot;&gt;模型与调度：把“选模型”交给系统&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;多模型动态调度的分层架构示意&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/8716ff4b6f6e379e0c3a0afeef2c9041.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Qoder 内置多款前沿模型（包含 Qwen3.8-Max 等），并引入 Auto 智能调度：根据任务阶段与目标，在效果、速度与成本之间动态取舍。实践中，常见的组合是“强模型做规划和关键生成，快模型做检索、改写与回合交互”，既控成本也保质量。结合过去一年在 Agent Harness 的工程化积累，系统在工具调用可靠性、异常恢复与结果验证方面更可控。&lt;br /&gt;
这种“分层选型 + 动态调度”值得关注：一方面把模型选择的复杂度交还平台，降低使用门槛；另一方面也为企业级治理预留了抓手，可根据预算、合规域与任务敏感度设定白名单、上限和回落策略。&lt;/p&gt;
&lt;h3 id=&quot;_5&quot;&gt;连接器、插件与技能：让智能体进入真实工作流&lt;/h3&gt;
&lt;p&gt;智能体只有接入真实上下文与系统，价值才会发生。Qoder 支持 40+ 连接器、70+ 插件与 2 万+ 技能，贯通代码仓库、项目管理、云服务与各类内部工具，让任务在实际环境中跑起来。典型工程流可被自动化为：&lt;br /&gt;
- 读取仓库与项目背景，生成改造方案与影响面分析&lt;br /&gt;
- 开分支、改代码、写单测、跑流水线&lt;br /&gt;
- 提交 PR、归纳变更说明，并根据检查结果迭代&lt;br /&gt;
为长程与复杂任务，Qoder引入结构化执行：&lt;br /&gt;
- Plan：在动手前梳理需求、方案与步骤，形成可审阅的执行蓝图&lt;br /&gt;
- Goal：围绕明确目标的持续执行与自我验证，确保不偏航&lt;br /&gt;
- 侧边任务：处理主线中的细节与衍生问题，不打断当前主流程&lt;br /&gt;
这套“计划—目标—侧任务”的层级化设计，有助于减少遗漏与回溯，提升可追溯性与团队协作透明度。&lt;/p&gt;
&lt;h3 id=&quot;_6&quot;&gt;多模态在场感：语音、桌面“伙伴”与记录能力&lt;/h3&gt;
&lt;p&gt;Qoder加入实时语音、桌面宠物、速记板与录音纪要等能力，构建更自然的“在场感”。用户可以边说边改需求，系统一边同步计划、一边执行与验证，无需每次重述完整指令。对非技术用户而言，这相当于把“专家助手”常驻在桌面与会议之中，让复杂的开发与数据处理任务以更低门槛被触发与跟进。&lt;/p&gt;
&lt;p&gt;此外，Qoder 家族化布局覆盖多个入口与形态：&lt;br /&gt;
- Qoder（工作台）、Qoder IDE、Qoder CLI、JetBrains 插件、移动端&lt;br /&gt;
- 数字员工产品 QoderWake、云端智能体 Qoder Cloud Agents&lt;br /&gt;
自 2025 年起面向全球提供服务，当前已覆盖 600 万以上用户与 10 万家企业客户，为规模化应用打下基础。&lt;/p&gt;
&lt;h2 id=&quot;_7&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;从产品形态看，Qoder代表了从“代码辅助”到“任务交付”的跃迁。其潜在影响体现在三方面：&lt;br /&gt;
- 对开发团队：工作重心从写代码本身，转向“定义目标—审查计划—验收结果”。在标准化工程链路（需求澄清、测试覆盖、PR 审核、回滚预案）上，智能体能承担高频与机械环节，工程师投入则更多回到架构、权衡与关键决策。相应地，需要引入面向智能体的度量与治理，如变更可追溯性、失败回放、质量门禁与成本预算。&lt;br /&gt;
- 对企业数字化：当连接器覆盖主流业务系统，跨系统的“拉通式”任务（如从工单到代码修复，再到发布与公告）可一体化交付。与此同时，安全与合规将成为落地前提：细粒度权限、最小化数据出境、日志审计与成本配额，都是部署时的必答题。&lt;br /&gt;
- 对生态竞争：行业正从“模型+插件”走向“工作台+生态”。Qoder以 Coding 为锚点，适合工程密集型场景；其连接器与技能规模有望形成网络效应。但真正的壁垒在于稳定的长程执行与组织级治理，这需要持续的 AgentOps 能力建设与大规模实践打磨。&lt;/p&gt;
&lt;p&gt;展望未来，几个看点值得追踪：&lt;br /&gt;
- 行业模板与最佳实践包，降低垂直场景的上手成本&lt;br /&gt;
- 更强的跨任务记忆与目标追踪，支持多周迭代的项目运行&lt;br /&gt;
- 端到端可观测与 A/B 体系，量化质量与成本收益&lt;br /&gt;
- 利用合成数据与回放机制提升鲁棒性与安全性&lt;br /&gt;
- 与知识库、流程引擎、RPA、低代码平台的深度联动，构建企业“自运转”工作流&lt;/p&gt;
&lt;p&gt;当“说清目标”逐步等同于“交付结果”，智能体工作台将成为基础生产力设施。全新 Qoder 的推出，不只是增加了一个工具，而是在推动工程与业务协作范式的更新。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;AI智能体&lt;/code&gt; &lt;code&gt;编程助手&lt;/code&gt; &lt;code&gt;企业数字化&lt;/code&gt; &lt;code&gt;多模态交互&lt;/code&gt; &lt;code&gt;大模型调度&lt;/code&gt;&lt;/p&gt;</description><pubDate>Fri, 28 Aug 2026 08:33:51 +0800</pubDate></item><item><title>商汤首次盈利：从价格战到结果交付</title><link>https://9842.cn/?id=757</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/e600b9bade8eecb7e39b2a2a8d264a90.png&quot; alt=&quot;商汤首次盈利：从价格战到结果交付&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;首次盈利背后的方法论：从价格竞争转向结果交付&lt;/h2&gt;
&lt;p&gt;商汤在2026年上半年实现首次盈利6.2亿元，经常性收入与毛利率同步提升。这不是一次“幸运拐点”，而是战略组合拳的阶段性兑现：一套统一模型体系、一座可扩展的 Token 工厂、以及面向企业与个人的智能体管控系统。其共通逻辑，是把AI能力从“算力—模型—调用”链条，升级为“智能产能—任务编排—结果交付”的闭环，从而摆脱单纯的价格战，获得更强的定价权与持续现金流。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;一套模型的统一与进化：从多模态到物理智能&lt;/h2&gt;
&lt;p&gt;商汤以“统一多模态架构+系统能力”推动模型迭代，密集发布 NEO-Unify、SenseNova U1/U1.5/U1.5-Lite、SenseNova Vision、办公场景智能体 SenseNova 6.8-Flash-Lite、内容创作模型 U1-Pro、空间智能模型 SI-8B，以及与大晓机器人联合开发的 Kairos 3.1 世界模型。多个核心基准对标 Gemini、GPT、DeepSeek 并持平或超越，U1 系列开源四个月 GitHub 累计超1.1万星。&lt;/p&gt;
&lt;p&gt;统一架构的价值在于：&lt;br /&gt;
- 最小化模型碎片化，形成参数、数据、优化策略的规模效应；&lt;br /&gt;
- 降低产品线维护成本，把更多资源投入在“智能上限”的持续提升；&lt;br /&gt;
- 为后续的智能体和行业化能力提供一致的底层接口与能力边界。&lt;/p&gt;
&lt;p&gt;值得注意的是，商汤正将数字智能延伸至物理世界：空间智能、世界模型与具身智能协同，意在把“理解—生成—执行”真正落到机器人与终端设备的可控行为上。这是从“会算、会说”迈向“会做”的关键路径。&lt;/p&gt;
&lt;h2 id=&quot;token&quot;&gt;Token 工厂：把算力转化为“智能产能”&lt;/h2&gt;
&lt;p&gt;&lt;img alt=&quot;将算力转化为智能产能的概念化“Token工厂”&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/736099948ddd6bcb5d7c6a90649577b9.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;“Token 工厂”本质是算力与模型联合优化的智能生产体系。2026年7月，商汤大装置日均 Token 服务量达2.4万亿，同比增长约22倍；总算力规模达到4.8万P。通过模型适配、推理优化、异构调度、能源管理与全球交付，工厂不仅扩大产能、拉低单位 Token 成本，也在持续提升单个 Token 的“含智量”。&lt;/p&gt;
&lt;p&gt;具体成效包括：&lt;br /&gt;
- Agent 模型上下文训练速度提升2倍，图像与视频生成效率提升6倍；&lt;br /&gt;
- 强化学习训练效率提升，研发到规模化部署周期缩短至1周；&lt;br /&gt;
- 对外服务4家基础模型厂商，在AI4S、视频生成、具身智能、世界模型及城市级场景形成差异化能力。&lt;/p&gt;
&lt;p&gt;在供给侧安全与成本控制方面，商汤推动国产算力生态：主流国产芯片MFU较原厂基准最高提升2.5倍，U1与十余家国产芯片 Day 0 适配。算电协同Agent实现96%负荷预测准确率，累计节约电力成本超1200万元，每万P年碳减排约2.4万吨。这意味着在性能、成本、绿色与自主可控之间找到兼顾平衡。&lt;/p&gt;
&lt;h2 id=&quot;_3&quot;&gt;智能体走向“结果交付”：经常性收入的抓手&lt;/h2&gt;
&lt;p&gt;&lt;img alt=&quot;智能体编排与结果交付的抽象示意&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/46b243171952fbfa83ce0c719e3176f5.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;在模型和Token能力之上，商汤以统一智能体管控系统连接模型、知识、工具和工作流，把“API调用”升级为“任务交付”。这一转型对商业模式的影响显著：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;企业侧：期内服务超1000家客户，覆盖教育、政务、营销、物流、银行、保险等20+行业。办公智能体“小浣熊”服务联想、平安科技、三大电信运营商、京东、麒麟软件等，用户同比增长超5倍，企业用户超6倍，云端月活跃近10倍。&lt;/li&gt;
&lt;li&gt;创作侧：视频生成智能体 Seko 单日产量达1万分钟，相关内容累计播放量估计超15亿次，10部短剧播放量各自突破1亿。&lt;/li&gt;
&lt;li&gt;个人与小团队：面向健康、财务、个人创作的“咔皮”系列累计用户突破4500万，顺应 One Person Company 的生产力趋势。&lt;/li&gt;
&lt;li&gt;海外与行业入口：视觉AI业务收入5亿元，占比约17%，覆盖20+国家和地区，累计服务客户4500+，老客户收入贡献率达67%，体现粘性与复购能力。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;“智能体即服务”的本质，是把计费从“算力/调用”转向“场景/结果”。这强化了经常性收入，也提升了客户迁移成本与生命周期价值。&lt;/p&gt;
&lt;h2 id=&quot;_4&quot;&gt;影响与展望：从商业韧性到生态位的确立&lt;/h2&gt;
&lt;p&gt;首先，盈利由多因素驱动。经常性收入与毛利率的持续提升，意味着核心业务健康度在增强；生态投资的公允价值变动亦带来正向贡献，但中长期仍需看经营性现金流与经常性收入的稳定增长质量。&lt;/p&gt;
&lt;p&gt;其次，“一套模型+Token 工厂+智能体”的闭环，给出摆脱价格战的范式：用统一架构提升上限，用工厂化能力压低成本，以智能体承接交付、沉淀数据与行业Know-how。这一飞轮一旦跑稳，将带来规模与学习效应的复合增长。&lt;/p&gt;
&lt;p&gt;再次，国产算力协同与算电优化，是成本与供给安全的关键护城河。随着多模态与视频、智能物理系统的计算需求快速上行，谁能更快把“算”转化为“智”，谁就更有定价权。&lt;/p&gt;
&lt;p&gt;需要关注的仍有三点：&lt;br /&gt;
- 竞争强度：国际前沿与开源社区快速迭代，技术与成本领先难以长期静态保持；&lt;br /&gt;
- 质量与安全：智能体深度进入工作流，可靠性、合规与安全对交付尤为关键；&lt;br /&gt;
- 收入结构：生态公允价值波动性较高，经常性收入和海外业务的持续拉动将是更具确定性的指标。&lt;/p&gt;
&lt;p&gt;展望未来，商汤若能在行业大模型的垂直化、智能体的工具链与工作流深融、以及世界模型与具身智能的可复用能力上继续拉开差距，有望进一步确立“智能产能提供商+结果交付服务商”的生态位，真正把AI从“演示效果”变成“可计费的稳定生产力”。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;商汤科技&lt;/code&gt; &lt;code&gt;大模型&lt;/code&gt; &lt;code&gt;Token工厂&lt;/code&gt; &lt;code&gt;智能体&lt;/code&gt; &lt;code&gt;AI商业化&lt;/code&gt;&lt;/p&gt;</description><pubDate>Thu, 27 Aug 2026 14:38:56 +0800</pubDate></item><item><title>Qwen3.8-Flash加速千问办公：快省更智</title><link>https://9842.cn/?id=756</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/ef3e4e34da184218999f9ca85fa44d60.png&quot; alt=&quot;Qwen3.8-Flash加速千问办公：快省更智&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;qwen38-flash&quot;&gt;速度、成本与智能的三重突破：Qwen3.8-Flash在千问办公的意义&lt;/h2&gt;
&lt;p&gt;8月26日晚，千问办公将刚发布的Qwen3.8-Flash模型首发接入，并以全新的“标准模式”面向所有用户开放。这一次升级不只是把模型换新，更是对办公场景中的“效率与性价比”重新定义：单任务生成速度约翻倍、平均Token消耗下降至原来的四分之一。结合模型与Agent的协同优化，千问办公将供给体系简化为“标准/高级”两档，预计95%的日常任务由标准模式覆盖，仅少数复杂任务需要高级模式。&lt;/p&gt;
&lt;p&gt;从行业视角看，这是一次直指“不可能三角”的尝试——在真实应用里，高性能通常意味着高成本与高延迟，低成本往往要牺牲智能。而这次的组合拳，试图让速度、成本、智能同时向好。&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;核心内容&lt;/h2&gt;
&lt;h3 id=&quot;_2&quot;&gt;标准模式背后的架构升级&lt;/h3&gt;
&lt;p&gt;Qwen3.8-Flash采用全新架构与千亿级总参数，官方给出的对比称其综合性能已经超越Claude Opus 4.6。更关键的是，千问团队针对办公场景打造了专属版本，从“多步规划、工具选择、上下文压缩”等真实痛点出发进行专项训练与推理优化，并引入定制的Harness架构以进一步提升吞吐效率。&lt;/p&gt;
&lt;p&gt;这意味着标准模式不只是“低价版”，而是面向高频办公任务的“主力版”。其设计目标是让绝大多数需求在默认模式下即可“快、稳、够用”，把高级模式留给极长上下文、复杂跨工具编排或高强度推理任务。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;核心指向：多步任务更少走弯路、工具调用更精准、上下文更紧凑&lt;/li&gt;
&lt;li&gt;架构思路：用推理链路与系统层优化，换取可观的速度提升与Token压缩&lt;/li&gt;
&lt;li&gt;结果表现：速度约提升100%，Token消耗平均减少75%&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;token&quot;&gt;吞吐与Token：效率从哪里来&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;抽象展示Token吞吐与上下文压缩的流程&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/06da0f13ec231ae28981c774b8f3dbcc.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;“更快更省”的实现，往往不是单点突破，而是多环节的耦合优化。Qwen3.8-Flash在千问办公的表现，可以从三条路径理解：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;更高的Token吞吐与更短的思考路径：模型在输出侧“更会省词”，减少不必要的冗长解释与重复确认，兼顾信息密度与表达紧凑。&lt;/li&gt;
&lt;li&gt;上下文压缩与语义聚合：通过对历史对话与资料进行更智能的裁剪与摘要，保留必要语义而非机械截断，降低上下文长度的同时维持相关性。&lt;/li&gt;
&lt;li&gt;工具选择的策略化：在办公场景中引导模型更快决策“是否调用工具、调用哪个工具、以何种参数调用”，减少无效往返与失败重试。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;简化来说，速度的提升来自“更少思维停顿+更快输出”，成本的下降来自“每个Token更有价值”。这也强化了“智能密度”的概念：不是单纯堆长输出，而是在有限Token中传递更高的信息量与更可靠的决策。&lt;/p&gt;
&lt;h3 id=&quot;agent&quot;&gt;Agent与模型的深度协同：打破“不可能三角”&lt;/h3&gt;
&lt;p&gt;&lt;img alt=&quot;Agent与模型协同编排、平衡速度成本与智能的概念图&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/791cc4d44d479646b5819b90b0a7b16c.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;单靠模型升级，往往难以同时兼顾性能、成本与速度。此次千问办公强调的，是Agent与模型的双向优化与协同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;提示与工具的结构化：为常见办公任务提供更明确的意图模板、函数调用Schema与状态管理，让模型在既定规则内高效执行。&lt;/li&gt;
&lt;li&gt;上下文治理：面向多轮对话与长文档，采用策略化的摘要、引用与缓存，减少重复传输与理解负担。&lt;/li&gt;
&lt;li&gt;任务编排与容错：为复杂流程设定阶段目标、检查点与回退路径，降低长期推理的失败率。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这种协同让系统像一位熟练的“项目经理”，不再把所有决策交给模型的自由发挥，而是以工程化设计减少无谓消耗，实现可预期的效率与质量。在真实办公场景，比如跨表数据对比、周报生成、会议纪要与行动项提取、跨应用操作等，这类编排尤为关键。&lt;/p&gt;
&lt;h3 id=&quot;_3&quot;&gt;标准与高级的边界：如何选择&lt;/h3&gt;
&lt;p&gt;千问办公将供给体系收敛为“标准/高级”两档，是为了让用户理解成本—性能的最佳配比。实操中可参考以下选择建议：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;优先使用标准模式：&lt;/li&gt;
&lt;li&gt;常规文本生成、摘要、改写与润色&lt;/li&gt;
&lt;li&gt;结构化提取、基础数据对比与轻量表格处理&lt;/li&gt;
&lt;li&gt;单工具调用或少量API编排的任务&lt;/li&gt;
&lt;li&gt;选择高级模式的触发条件：&lt;/li&gt;
&lt;li&gt;超长上下文、多来源资料的融合与一致性验证&lt;/li&gt;
&lt;li&gt;强推理密度任务，如复杂代码生成与跨系统事务编排&lt;/li&gt;
&lt;li&gt;对准确性、稳定性与可解释性有更高要求的关键流程&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这类明确分层，使绝大多数办公需求“开箱即用”，复杂场景则按需升级，避免“为少数极端任务牺牲整体成本结构”。&lt;/p&gt;
&lt;h2 id=&quot;_4&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;在企业侧，标准模式的性能与成本改进意味着更现实的落地路径：AI从“试点工具”走向“生产力基础设施”，预算不再被少数重任务牵制。与此同时，产品界面的两档模式降低了决策复杂度，团队可以更好地做任务拆分与资源调度，将AI纳入常规工作流。&lt;/p&gt;
&lt;p&gt;在生态侧，关注点正在从“参数规模”转向“智能密度与每Token价值”。这不仅是模型能力的转型，也是工程方法的升级：更好的Agent设计与系统优化能够在不增加模型体量的情况下，显著改善真实体验。未来可以预期：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;行业专属版本增多：面向财务、人力、法务、客服等场景的定制Flash，将用更窄更深的训练与推理优化提升专业任务表现。&lt;/li&gt;
&lt;li&gt;端侧与边缘协同：在隐私与低延迟需求下，通过更高效的推理策略与缓存机制，把部分推理迁移到本地或边缘节点。&lt;/li&gt;
&lt;li&gt;多Agent编排普及：将复杂流程拆分为可复用的Agent角色，统一由调度层管理，提升稳定性与可维护性。&lt;/li&gt;
&lt;li&gt;评估体系更新：除了常规基准，还需要长期链路稳定性、工具调用成功率、上下文压缩质量等“应用侧指标”来衡量系统好坏。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要强调的是，任何“更快更省”的系统都要关注一致性与稳健性。对企业而言，建立可观测性与质量保障机制至关重要：记录关键任务的上下文裁剪质量、结果一致性与工具调用成功率，并以此迭代提示模板与编排策略。只有把性能优势落实到可复用的流程与规范，智能密度的提升才能真正转化为组织的生产率红利。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;Qwen3.8-Flash&lt;/code&gt; &lt;code&gt;千问办公&lt;/code&gt; &lt;code&gt;Agent协同优化&lt;/code&gt; &lt;code&gt;大模型推理&lt;/code&gt; &lt;code&gt;智能密度&lt;/code&gt;&lt;/p&gt;</description><pubDate>Thu, 27 Aug 2026 14:34:59 +0800</pubDate></item><item><title>阿里Qwen3.8-Flash：6B激活，越级性能</title><link>https://9842.cn/?id=755</link><description>&lt;p class=&quot;post-cover&quot;&gt;&lt;img src=&quot;https://9842.cn/zb_users/upload/2026/08/928bc6cdaa740bdf4763243f2683201e.png&quot; alt=&quot;阿里Qwen3.8-Flash：6B激活，越级性能&quot; style=&quot;max-width:100%;height:auto;&quot; /&gt;&lt;/p&gt;
&lt;h2 id=&quot;_1&quot;&gt;引言&lt;/h2&gt;
&lt;p&gt;阿里在8月26日晚发布并开源的千问 Qwen3.8-Flash，用一个核心命题刷新了当下大模型的认知：以更少的激活参数，跑出更强的综合性能与更低的成本。其“Next”新架构下，Transformer总参数达 125B，却仅激活 6B，就在智能体编程、长程任务与多模态推理等关键评测上超过 Claude Opus4.6、逼近 Opus4.8。同时，训练成本较上代骤降近 90%，推理按百万 tokens 计价的输入 1 元、输出 3 元，将性价比推到新的低点。这不是单纯的参数游戏，而是一次在注意力、信息通道与“外挂记忆”上的系统性重构。&lt;/p&gt;
&lt;h2 id=&quot;6b125b&quot;&gt;架构与训练：为何“6B激活”能跑出“125B的质感”&lt;/h2&gt;
&lt;p&gt;&lt;img alt=&quot;示意大模型少量激活、稀疏注意力与多通道残差&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/7a0230325c3996b91919b5cfcc07926b.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Qwen3.8-Flash是一个多模态 MoE 模型，但关键在“Next”架构对计算路径和知识寻址的重新设计，解决了以往“参数多但用不起来”的痛点。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;混合注意力：自研 QSA（Qwen Sparse Attention）与 GDN 高效融合，针对长上下文进行稀疏化与缓存命中优化。在高缓存命中的 1M tokens 实际场景中可提速 8 倍以上，兼顾长程依赖与推理速度。&lt;/li&gt;
&lt;li&gt;Gated Residual：把传统 Transformer 的单通道残差扩展为 4 条“可读可写”的信息通道，模型可动态选择信息流，降低无效计算与梯度震荡，提升训练稳定性与收敛效率。&lt;/li&gt;
&lt;li&gt;N-gram Embedding：新增 51B 规模的 n-gram 嵌入作为“记忆指南手册”，在每次 token 计算时无需参与主干计算，相当于以极低开销提供更丰富的短语与模式知识索引，提升知识检索与文本生成的精准度。&lt;/li&gt;
&lt;li&gt;训练协同优化：结构与训练算法同步迭代，吞吐与收敛并进，使 MoE 的路由与专家利用率更均衡，从源头降低能耗与成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些设计的共同指向，是把“有效计算”压到最优：大参数承载知识广度，小激活保证推理开销；稀疏注意力与可控通道，让真实任务中的长程与多模态场景“又快又准”。&lt;/p&gt;
&lt;h2 id=&quot;_2&quot;&gt;性能与成本：用数据说话，也要看边界&lt;/h2&gt;
&lt;p&gt;在仅完成预训练的基座阶段，Qwen3.8-Flash在 SuperGPQA、GSM8K、SWEBench-Pretrain 等能力上超过了同家族三倍体量的 Qwen3.7-Plus 基座。经后训练后，智能体与多模态任务的跃迁更为明显：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;智能体编程：SWE-bench Pro 领先 Opus4.6 多达 9.1 分；专业工作任务 JobBench 超出近 20 分；长程专业任务 CoWorkBench、真实工具调用 Toolathlon Verified 均优于 DeepSeek-V4-Flash。&lt;/li&gt;
&lt;li&gt;多模态能力：AndroidWorld（模拟手机操作）高出 22.5 分；MathVision（视觉数学推理）高出 25.1 分；具身智能 ERQA 领先 31.5 分。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;成本端的对比同样直白：训练成本较 Qwen3.7-Plus 下降约 90%；推理计价降至输入每百万 tokens 1 元、输出 3 元，是 Opus4.6 的约 3%，低于 DeepSeek-V4-Flash的部分价位。需要指出的是，不同厂商的计价策略与评测框架并不完全可比，但在同类任务与公开基准上的相对优势，足以说明“Next”架构的效率红利确实落到了可见的性能与价格上。&lt;/p&gt;
&lt;h2 id=&quot;_3&quot;&gt;应用场景与生态：从“千问办公”到开源社区&lt;/h2&gt;
&lt;p&gt;&lt;img alt=&quot;示意智能体在办公与开源生态中的连接网络&quot; src=&quot;https://9842.cn/zb_users/upload/2026/08/d81958c8b6def063c50ea35e4373aaec.png&quot; /&gt;&lt;/p&gt;
&lt;p&gt;Qwen3.8-Flash已在“千问办公”首发内置，官方称可覆盖约 95% 的日常办公任务，并针对 Agentic 能力与 Harness 框架做了联合优化，提升跨工具、长链路与协作场景的稳定性。这一落地路径意味明确：不只做通用大模型，更要把智能体能力打磨到可替代真实工作流程。&lt;/p&gt;
&lt;p&gt;在开源与生态方面，“Next”架构被视为 Qwen4 的雏形，Qwen3.8-Flash-Next 权重已面向社区开放，推动复现与验证。Qwen3.8 系列已发布包含 2.4T 总参数量的 Qwen3.8-Max、以及 Qwen3.8-27B、Qwen3.8-Flash 等多尺寸模型，全球下载量突破 30 亿次、衍生模型数超 30 万，开源生态的规模效应正在形成：更多社区模型将吸收稀疏注意力、通道门控与大规模 n-gram 嵌入的做法，推动“高效大模型”的范式扩散。&lt;/p&gt;
&lt;h2 id=&quot;_4&quot;&gt;影响与展望&lt;/h2&gt;
&lt;p&gt;Qwen3.8-Flash把“更强性能—更低成本—更好可用性”三个目标同时拉近，可能引发三方面变局：&lt;br /&gt;
- 效率基准提升：激活参数与总参数的结构性优化将成为新常态，厂商竞争重心转向“谁能用更少算力提供更强能力”。&lt;br /&gt;
- 应用扩张加速：推理成本的显著下降，将使智能体在办公、研发、客服与移动端自动化等场景的普及更快，企业可以按业务链路配置模型能力而非被算力预算“绑架”。&lt;br /&gt;
- 开源竞合升级：开源释放了复现与二次创新的空间，但也带来“价格战”与泛化能力的压力；在长程任务的稳定性、安全与合规方面仍需持续验证与对齐。&lt;/p&gt;
&lt;p&gt;下一步看点在于两条线：其一，“Next”架构在 Qwen4 的全面化与稳态化，是否能在更广泛的多模态与跨设备场景维持领先；其二，围绕长上下文与智能体编排的工程体系，能否把评测上的优势转化为企业级规模部署的可维护性与可控风险。若这两点得到持续兑现，Qwen3.8-Flash不只是一次性能与价格的突破，更可能成为下一代通用 AI 的工程范式注脚。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; &lt;code&gt;Qwen3.8&lt;/code&gt; &lt;code&gt;大模型&lt;/code&gt; &lt;code&gt;架构创新&lt;/code&gt; &lt;code&gt;智能体&lt;/code&gt; &lt;code&gt;开源生态&lt;/code&gt;&lt;/p&gt;</description><pubDate>Thu, 27 Aug 2026 08:33:29 +0800</pubDate></item></channel></rss>