腾讯云 AI DLC:打通数据湖与智能 Agent 的创新之路
打通数据湖到智能 Agent:腾讯云 AI DLC 的技术突破
随着人工智能应用从单一模型逐渐演化到复杂的 Agent 系统,对数据处理效率和算力利用率的要求也在不断攀升。腾讯云近日发布的智能数据湖计算平台 AI DLC,不仅构建了从数据处理到 Agent 应用的一体化链路,还实现了对传统 AI 开发流程的深度优化。本文将从技术架构、性能优势和实际应用三个角度,解析这一平台的革新之处。
从繁琐到一体化:AI DLC 的架构创新

传统的 AI 应用开发流程普遍存在多个平台割裂的问题。企业通常需要先借助 Spark 进行数据清洗和预处理,再将处理结果存储到数据湖中,由 AI 团队使用 Ray 等框架完成模型训练和推理。这种多平台协作不仅导致了数据搬运的高成本,还让权限和算力资源的管理复杂化。
AI DLC 的核心创新在于实现了 Spark 与 Ray 在同一平台上的无缝对接。具体来说,Spark负责大规模数据处理和特征提取,而Ray则承接多模态数据的处理、模型训练以及推理任务。两者共享数据存储、权限体系和算力资源,使得数据处理完成后可以直接进入后续的训练和推理环节,无需跨平台搬运。
此外,AI DLC 采用 Serverless 架构,支持算力按需秒级弹性伸缩。企业无需预留固定的计算集群,可以按任务使用时长计费。这种设计不仅降低了资源浪费,还简化了运维工作,极大提升了开发效率。
性能全面提升:从计算效率到资源利用率
AI DLC 的优势不仅体现在一体化的架构上,还覆盖了计算性能和资源利用效率的优化。平台内嵌腾讯云自研的两大引擎:Meson向量化计算引擎和Xpark多模态计算引擎。
Meson向量化计算引擎兼容主流 Spark API 和 SQL 语法,显著提升了数据查询性能。在标准测试中,Meson对复杂查询的加速效果最高可达5倍,同时 CPU 使用率下降近50%。这一性能提升对处理海量数据的企业尤其重要。
Xpark多模态计算引擎则聚焦图像、文档、音视频等多模态数据处理。其推理吞吐量比开源方案提升了3倍,并实现 GPU 的高效利用,长期保持接近100%的利用率。这种设计不仅降低了算力成本,还显著加快了模型推理速度。
在算力资源调度方面,AI DLC 打破了传统固定集群的限制,将 CPU、GPU、TPU 等异构资源纳入统一资源池,动态分配给数据处理、训练和推理任务。任务完成后,资源会自动释放并分配给其他作业。这一机制使得资源利用率提升了数倍,同时适配了国产主流 GPU 芯片,为企业提供了更自主可控的算力底座。
从模型到 Agent:推动智能应用落地
AI DLC 的另一亮点在于对智能 Agent 应用的全面支持。传统的数据平台主要用于支撑数据分析,而 AI DLC 则进一步扩展到支持 Agent 的持续运行和迭代。Agent 产生的轨迹、记忆和反馈数据可以直接沉淀到数据湖中,经过处理和训练后反哺 Agent 系统,从而形成闭环的智能应用流程。
以腾讯内部的 WorkBuddy 为例,这一 Agent 系统在运行过程中会产生海量用户交互数据,其中部分单字段数据量达到 GB 级。接入 AI DLC 后,这些数据可以直接完成清洗、特征提取、模型后训练和评估回流,从而构建可复用的数据与训练流水线。事实证明,接入 AI DLC 后,WorkBuddy 的端到端处理时间减少了80%,所需算力也下降到此前的五分之一。
此外,AI DLC 提供 MCP、Skills 和 Open API 等功能,帮助 Agent 调用数据处理、训练和分析能力。这种开放式设计不仅提升了 Agent 的智能化水平,还增强了企业开发定制化 Agent 系统的灵活性。
影响与展望:数据湖的智能化未来
AI DLC 的发布标志着数据湖平台进入智能化的新阶段。它不仅优化了企业开发 AI 应用的效率,也为 Agent 的持续迭代和运行提供了坚实的技术支撑。在自动驾驶、具身智能等场景中,这种数据与智能应用的深度融合将进一步推动技术的落地。
例如,博世的自动驾驶测试车辆每天产生大量视频和传感器数据,通过 AI DLC 的统一调度机制,这些数据能够高效完成脱敏、特征提取和模型推理,从而形成一个数据闭环。类似的应用场景还将扩展到医疗、金融、零售等行业,帮助企业从数据资产中挖掘更大的价值。
未来,随着 Agent 系统的普及,数据湖平台的角色将从单一数据支撑逐渐演化为智能应用的底座。腾讯云 AI DLC 的实践为这一转变提供了一个可参考的范例,也让我们对智能化数据湖的前景充满期待。
标签: 腾讯云 智能数据湖 AI Agent 自动驾驶 人工智能