TL;DR:
AI基础设施正经历从“算法适配”向“自主调度”的范式转移,模型能力的涌现使开发者能从繁琐的内核适配中抽身,转向定义SLA与成本预算的系统治理角色。这一演进预示着AI Infra将最终被模型驱动的自主系统接管,软件开发正进入“即抛型”与“模型脚手架”并存的新时代。
从“算法爷”到“AI管家”:范式的逆转
在人工智能发展的早期阶段,“算法爷”是行业内对AI Infra从业者地位的调侃,Infra工程师往往是算法创新的“幕后苦力”。然而,随着推理工程复杂度的指数级增长——特别是DeepSeek MoE架构、全模态处理(Omni)以及异构算力集群管理的普及——人类手动维护工具链的速度已难以为继。
这种失衡正在引发一场深刻的工程哲学变革。正如InfoQ直播中所述,软件工程长期积累的“屎山”负担,因模型能力的提升首次出现了“被逆转”的可能。Infra的核心角色正在发生位移:不再是单纯的算子实现与算力压榨,而是站在更高阶的SRE视角,通过定义SLA(服务水平协议)、SLO(服务水平目标)和成本预算,将具体的执行逻辑交给AI模型。
异构算力的管理深渊与标准化的悖论
随着国产算力生态的快速崛起,NPU、GPU与各种异构硬件的混用成为“必答题”。不同芯片架构、算子实现的细微差异,使得异构调度成为AI Infra面临的最大“暗礁”。
- 技术挑战:一致性保障是当前最大的痛点。在不同硬件间迁移模型时,哪怕是极小的tensor shape差异都可能导致计算错误。这种硬件生态的碎片化,使得传统的Device Plugin架构在复杂的AI工作负载面前显得力不从心。
- 趋势预测:Kubernetes的DRA(Dynamic Resource Allocation)虽然提供了更精细的设备抽象,但在面对高度动态的AI模型调度(如Prefill与Decode阶段的动态分离)时仍显滞后。未来,能够感知模型计算特性的“语义化调度器”将替代通用的K8s插件,成为AI基础设施的核心组件。
AI作为脚手架:开源生态的马太效应
在多模态与全模态模型(如vLLM Omni)的需求下,构建单一、封闭的推理引擎已无可能。开源社区正演变为一个巨大的“脚手架”生态。
“工具会收敛,模型在前训练和后训练阶段都会将其作为重要参考去强化,形成明显的正向循环。”
这一洞察指出,那些能够提供清晰API、适配主流模型架构的开源项目,将通过数据的反哺(如PR收集、社区反馈),形成“模型-工具”协同进化的马太效应。那些试图通过闭源实现所谓“独家优化”的项目,在模型迭代速度面前只会越走越窄。
未来展望:基础设施的自主化与SRE的升维
展望2030年,AI基础设施将向着“黑盒化”和“自动化”演进。Infra工程师的工作重心将彻底从“写kernel、调算子”转向“架构设计与策略管控”。
- 即抛型软件的兴起:基于大模型的辅助,开发者可以针对特定任务快速生成、部署并迭代一段Infra代码。这种“即抛型”软件能够有效应对碎片化的场景,而不需要为了一个微小的需求去维护庞大的平台。
- 从实现者到规划者:随着模型逐渐学会管理内存碎片、处理异步任务以及感知硬件拓扑,人类工程师的价值将聚焦于对业务目标的定义。我们不再是代码的编写者,而是系统边界与资源限制的“设计师”。