CFP 开放 | KCD 杭州站邀您共议 Agent 时代的云原生、可观测与大模型推理

引言
KCD Hangzhou 将于 2026 年 11 月 28 日在杭州举行,即日起开启议题征集(截止 9 月 30 日)。在“Cloud Native in the Age of Agents”的大背景下,云原生与 AI 的交汇进入深水区:从 Agent 运行时到多 Agent 编排,从可观测语义到推理引擎的算力工程,Kubernetes 与 CNCF 生态正在成为新一代智能应用的“操作系统”。杭州长期孕育阿里巴巴、DeepSeek、宇树科技等创新主体,也是国家级 AI 创新试验区,具备扎实的工程土壤与社区氛围。就今年的议题设置和产业趋势来看,这是一次集中回答“Agent 时代软件如何被构建与运行”的技术峰值时刻。
核心内容
1. Agent on Kubernetes:为何正当时

AI Agent 正在从“调用模型的脚本”走向“有状态、有边界、有协作的服务”。这要求底座具备三件事:安全隔离、流量治理与可编排性。Kubernetes 天生契合:
- 安全隔离与运行时多样性:通过容器沙箱(如基于 Kata Containers、gVisor 的方案)、RuntimeClass、PodSecurity,既能隔离第三方工具调用与不可信代码,又保留开发迭代的灵活性。Agent 沙箱化不只是“安全”,也是稳定复现、审计与回放的前提。
- 流量治理与协议演进:Agent 的对外调用(模型、工具)与 A2A(Agent 到 Agent)通信需要精细化网关与策略。基于 CNCF Gateway API、Envoy/Ingress 网关,可对 MCP 等协议流量做认证、路由、节流与可观测注入;服务网格可为多 Agent 协作提供零信任基线。
- 编排与状态:多 Agent 协同需要任务拆分、角色注册、能力发现与容错恢复。K8s 的控制器模式与 CRD 为“Agent 编排器”“能力目录”等提供天然承载;事件驱动(如 Knative/Eventing)让 Agent 链路与外界系统解耦。
今年的 Track 1(Agent Infra)将围绕上述关键点展开,包括“Agent Gateway 在流量治理中的角色”“沙箱隔离策略”“多 Agent 编排、注册与通信”“工作负载调度与资源管理”等,旨在把“Agent 生产级运行”的经验沉淀为可复用的模式与接口。
2. 可观测与可靠性:从“请求-响应”到“推理-协作”的转变
传统可观测围绕服务拓扑与请求链路,而 Agent 时代多了语义层的不确定性与跨模型的协作复杂度。OpenTelemetry 作为 CNCF 成熟项目,正成为这场变革的基石,但需要扩展新的约定与采集策略:
- 语义与 Trace 标准化:不仅要看到“调用了哪个服务”,还要理解“调用的是什么能力”,包括模型版本、系统/用户提示、Token 维度延迟与吞吐、拒绝/中止原因、多 Agent 之间的上下文传递等。统一的 GenAI 语义规范与 Agent Trace 约定,有助于跨团队、跨平台地复现实验和问题。
- 评测与混沌工程:可靠性不仅是 MTTR 和错误率,还是“在分布式推理与协作下的稳健性”。引入混沌场景(模型降级、知识库偏移、外部工具超时),观察 Agent 策略切换与补偿路径,配合离线评测(正负样本集、任务覆盖度)形成闭环。
- 从可观测到运维智能:结合语义知识底座,把运行数据转化为运维知识与自动化决策,例如对“幻觉率”超阈触发的链路回退、对“prompt 漂移”的自动检测与修正建议。
Track 2(Observability & Reliability for AI)将聚焦“OpenTelemetry × GenAI 语义标准”“AI/Agent 可观测实践”“Agent 评测与混沌工程”“语义知识底座与智能运维”等主题,把 AI 的不确定性纳入工程可控的框架。
3. K8s 上的推理基础设施:把算力变成“平台能力”

Agent 只是“表层行为”,其背后的算力与调度,决定着体验与成本的上限。Kubernetes 已成为开源推理引擎与平台工程的共识底座:
- 引擎与调度协同:vLLM、SGLang 等通过高效的内存管理与批处理策略提升吞吐,而在 K8s 上还需与 GPU 调度(MIG/多实例、拓扑感知、NUMA 亲和)、亲和/反亲和、节点优选等策略协同,避免“引擎很强、调度打折”的错配。
- 弹性与成本:结合 Knative/KEDA 的事件驱动弹性,按请求峰谷自动扩缩;通过批处理与推测解码优化延迟-成本曲线;冷启动与模型权重复用(本地缓存、镜像分层)是降本的关键细节。
- 数据与网络:模型仓库与向量检索涉及带宽与时延,CSI 存储、Sidecar 缓存、分层缓存策略与 CNI 配置都会影响端到端时延。跨可用区部署还需考虑数据亲和与复制一致性。
- 多租户与安全:共享 GPU 的租户隔离、资源配额与越权防护,既要守住平台边界,又要避免把算力切碎导致效率损失。
Track 3(AI Infra & LLM Serving)将集中讨论“推理引擎在 K8s 上的优化实践”“GPU 调度策略与平台工程”“多租户与隔离”“端到端服务质量”,让“算力即平台”落到可操作的清单与工具链。
4. CFP 实用指南:怎样的投稿更有说服力
上一届杭州站(2025)收获 82 份投稿、39 位讲师、316 名到场参会者与 2 万+ 线上观众,呼声最高的是“更深的 AI 实战与更多互动”。今年围绕“Agent on Kubernetes”的三大分论坛,投稿可考虑以下方向与写法:
- 选题聚焦
- Agent Infra:网关与协议治理、沙箱与隔离、Agent 注册/发现、编排框架、资源调度策略。
- Observability & Reliability:OTel × GenAI 语义、跨 Agent Trace 关联、评测与混沌工程、知识驱动运维。
- AI Infra & Serving:vLLM/SGLang 等在 K8s 的落地、GPU/MIG 调度、成本优化、弹性与多租户。
- 结构建议
- 问题定义与场景边界:业务目标、指标约束(吞吐、时延、稳定性、成本)、数据合规。
- 架构与实现:关键组件选择、权衡取舍、自动化/平台化手段,最好有可复现的配置或开源仓库。
- 指标与对比:基准数据、A/B 结果、失败案例与教训,同样重要。
- 可迁移性:哪些经验可以跨团队、跨行业迁移,哪些依赖难以复制。
- 常见误区
- 纯产品宣讲、无数据支撑的“结论先行”、对安全与合规避而不谈。
- 关键时间
- 大会时间:2026 年 11 月 28 日(杭州)
- CFP 截止:2026 年 9 月 30 日
影响与展望
Agent 时代的真正门槛,不在“是否能调通一个模型”,而在“是否能把智能当作可观测、可编排、可运营的基础能力”。Kubernetes 与 CNCF 生态提供了这套“工程语言”,而杭州站的议题设置,正是把分散的最佳实践汇聚成可复用的标准与模式:网关与沙箱定义边界,可观测语义定义真相,推理基础设施定义效率。
可以预见的趋势包括:
- Agent 流量治理将走向协议与策略的标准化,安全与性能不再二选一。
- OpenTelemetry 的 GenAI 语义会成为跨平台溯源与评测的“公共语言”,推动从指标采集到运维自动化的一体化闭环。
- 推理引擎与 K8s 调度将更深耦合,形成“面向算力的 PaaS”,让团队把精力放在任务与策略上,而非“搬运与堆砌”资源。
- 多 Agent 协同将从实验室走向生产,通过编排与回退策略,把不确定性压缩在可控范围内。
这个秋天,杭州将见证云原生与 AI 交汇的新坐标。期待更多基于真实问题、拿得出数据与教训的实践分享,一起把“Agent on Kubernetes”从口号变成方法论与工具箱。
标签: Kubernetes 云原生 AI Agent OpenTelemetry 大模型推理