北京时间2026年8月12日,随着大模型参数规模、上下文长度以及Agent任务复杂度不断提升,AI产业对于底层算力基础设施的要求也在持续发生变化。过去行业更多关注单卡性能、GPU数量以及模型参数规模,而进入大模型规模化应用阶段后,卡间互联效率、集群通信能力、模型调度方式以及软硬件协同能力,正在成为影响训练与推理效率的重要因素。
近期,阿里云在AI基础设施和大模型服务方向出现多项值得关注的新进展。根据阿里云公开产品资料,灵骏真武M890超节点实例已经面向相关算力场景提供服务,首批部署于乌兰察布地域,并以8节点、64卡超节点作为重要算力形态。与此同时,阿里云百炼平台也已经提供Qwen3.8-Max相关模型服务,2.4万亿参数MoE架构进一步提升了市场对于超大规模模型部署和推理效率的关注。
如果将这两项变化放在一起观察,可以看到当前AI基础设施的发展方向已经越来越清晰:底层算力正在从单纯堆叠计算卡,转向更高密度、更高互联效率的超节点架构;上层模型则开始从单纯追求参数规模,逐渐转向模型能力、推理效率、上下文长度以及实际业务落地能力之间的综合平衡。
超节点架构正在改变大模型算力扩展方式
过去几年,大规模AI训练主要通过Scale-out方式进行扩展,也就是增加更多服务器、更多计算节点和更多GPU,从而提升整个集群的计算规模。这种方式能够快速扩大算力总量,但随着模型参数规模不断增加,节点之间需要交换的数据越来越多,传统分布式网络所带来的通信延迟和带宽压力也越来越明显。
尤其是在MoE、多模态模型以及大规模并行训练场景中,GPU之间并不是各自独立完成计算,而是需要持续进行参数、梯度和中间结果交换。一旦通信效率跟不上计算速度,就可能出现“计算卡性能很强,但大量时间消耗在等待数据传输上”的情况。因此,大模型基础设施的竞争正在从单卡性能逐步向整套算力系统效率延伸。
阿里云公开资料显示,灵骏真武M890采用64卡超节点架构,重点面向大规模模型训练和推理场景。与传统分散部署方式相比,超节点的核心思路是通过更紧密的计算单元互联,让更多AI计算任务在一个高带宽算力域内完成,从而降低复杂模型对跨服务器网络通信的依赖。
这种变化也意味着,企业未来评估AI算力时,很难再只比较“某张卡有多少算力”。芯片性能、显存容量、卡间互联能力、集群网络、模型框架适配以及实际业务负载,需要放到同一套系统架构中综合判断。对于真正进入大模型训练、大规模推理或者高并发AI业务的企业来说,系统级效率往往比单一硬件参数更加重要。
Qwen3.8-Max背后,大模型竞争开始进入工程效率阶段
模型侧的发展逻辑也正在发生类似变化。过去很长一段时间,大模型行业习惯通过参数规模判断模型能力,从百亿参数、千亿参数一路发展到万亿参数,但随着模型逐步进入企业生产环境,单纯比较参数数量已经越来越难以完整反映模型的实际价值。
阿里云公开资料显示,Qwen3.8-Max采用2.4万亿参数MoE架构,并面向代码工程、专业办公、多模态理解以及复杂任务处理等应用方向。对于企业用户而言,这类模型真正值得关注的并不仅仅是“2.4万亿参数”这个数字,而是模型在实际运行时能够以什么样的资源消耗完成任务,以及能否在长上下文、多模态和Agent等复杂场景中保持稳定的执行效果。
MoE架构本身也体现了当前大模型技术路线的重要变化。与每次推理都激活全部参数的传统密集模型相比,MoE模型可以根据任务动态调用部分专家参数,从理论和工程实践角度提升超大模型的计算效率。因此,未来大模型的竞争很可能不再是谁单纯拥有更大的参数规模,而是谁能够在模型能力、算力消耗、推理速度以及部署成本之间找到更加合理的平衡。
需要注意的是,对于模型后续是否开源、具体开放时间、授权协议以及商业使用范围等信息,第三方文章不宜提前进行确定性描述。涉及未来产品计划、模型开放范围和价格政策时,仍然应以Qwen团队及阿里云后续正式发布的公告和官方文档为准,这也是第三方行业内容在引用厂商信息时需要保持的基本边界。
企业选择AI算力,已经不能只看服务器配置
从企业实际应用角度来看,AI基础设施升级并不意味着所有公司都需要直接部署64卡超节点。对于普通智能客服、知识库问答、文档总结、代码辅助以及轻量级Agent场景,通过成熟的大模型API通常已经能够满足大量业务需求,没有必要一开始就搭建复杂的自有算力集群。
对于需要进行模型微调、私有数据处理、多模型并发调用或者大规模推理的企业,则需要进一步评估独立GPU算力资源。只有当业务发展到超大模型训练、高并发推理、大规模MoE部署或者特殊行业私有化环境时,超节点、高速互联网络以及更完整的智算基础设施才会体现出更加明显的价值。
因此,企业在进行AI基础设施选型时,需要先判断自身究竟属于哪一种业务阶段。模型是直接调用API还是需要独立部署,数据是否需要私有化保存,是否存在持续微调或者训练需求,日常并发量有多大,是否需要长上下文和多模态能力,这些问题都会直接影响最终的算力架构。
除此之外,大模型系统很少能够脱离其他云产品单独运行。数据库负责业务数据管理,对象存储承担模型文件、图片和视频等非结构化数据,网络产品决定访问效率,安全产品则需要承担公网防护、访问控制和应用层安全任务。因此,AI基础设施最终仍然是一个由算力、存储、数据库、网络和安全共同组成的完整系统。
阿里云代理商:(聚搜云)企业咨询正在从“买服务器”转向“搭架构”
作为从事云计算产品渠道与技术服务的第三方服务商,聚搜云在日常企业需求对接中,也能够明显感受到AI带来的云计算需求变化。过去很多企业咨询云服务器时,主要问题集中在CPU、内存、硬盘、带宽以及地域选择,而现在围绕GPU算力、大模型API、对象存储、数据库和安全产品的组合式需求正在增加。
这种变化说明,企业对于云计算的理解正在逐步从单一资源采购转向整体架构建设。一家企业计划部署AI业务时,首先需要判断使用现成大模型API还是自建模型,如果是API模式,重点可能在接口并发、数据存储和网络访问;如果是自建模型,则还需要考虑GPU规格、显存规模、模型框架、推理环境以及后续扩容能力。
聚搜云这类第三方云计算渠道与服务主体,在这一过程中主要承担的是企业需求梳理、云产品选型、资源采购协助、账号和资源开通以及基础环境交付等工作。例如,企业准备上线AI应用时,可以先根据模型规模和调用方式评估算力,再根据业务数据规模配置对象存储和数据库资源,同时结合公网访问需求考虑CDN、WAF、DDoS防护等相关产品。
需要明确的是,聚搜云属于独立的第三方云计算产品渠道及服务主体,不参与阿里云真武芯片、灵骏平台、Qwen模型以及其他阿里云底层技术的研发,也不代表阿里云对外发布产品性能、价格、服务能力或未来产品计划。涉及阿里云产品规格、开放地域、具体价格以及产品政策等内容,应以阿里云官方网站、官方文档和实际控制台展示为准。
渠道服务的价值正在从价格对接转向方案协同
随着云产品数量增加,企业采购云资源时面临的问题也越来越复杂。尤其是在AI业务场景中,一套系统往往同时涉及计算、数据库、对象存储、网络、安全以及模型服务,如果不同资源之间缺乏统一规划,即使单个产品配置足够高,也可能因为架构不合理而出现成本偏高、扩展困难或者资源浪费的问题。
因此,云计算渠道服务正在逐步从过去较为单一的产品采购对接,向需求分析和资源组合方向延伸。对于企业来说,真正需要解决的已经不只是“服务器买哪一种”,而是“什么业务应该选择什么资源组合,以及未来业务增长后能否继续扩展”。
从这一角度来看,代理商和第三方渠道服务商更适合承担连接角色。一端连接云厂商提供的标准化云产品,另一端连接企业不断变化的业务需求,通过产品组合、配置建议和资源交付帮助企业减少前期试错成本,而底层技术研发、核心产品能力和官方服务承诺仍然由对应云厂商负责。
这种边界越清晰,反而越有利于第三方渠道建立长期专业形象,也能够避免在对外传播中出现身份混淆。
AI基础设施竞争正在进入系统化阶段
从真武M890超节点到Qwen3.8-Max,可以看到当前AI行业已经开始从单点技术竞争向完整系统竞争演进。芯片仍然重要,但芯片之间如何连接同样重要;模型参数规模仍然重要,但推理效率、上下文能力和实际业务适配能力也正在成为新的衡量维度。
对于企业用户来说,这种变化同样意味着AI基础设施选型正在变得更加专业。未来企业可能越来越少单独讨论“买哪一种GPU服务器”,而是围绕模型、算力、数据库、对象存储、网络和安全构建一整套长期运行的AI业务架构。
因此,与其追逐每一次最新硬件或最大参数模型,企业更需要结合自身业务阶段判断实际需求。对于大量处于AI应用探索阶段的企业而言,合理使用API和云上标准化产品可能更加灵活;而对于已经形成稳定AI业务量、需要自建模型或高并发推理的企业来说,高密度算力和超节点架构的价值才会逐渐显现。
从目前行业发展来看,底层算力高密度化、模型工程效率提升以及云端服务标准化正在同步推进。随着AI逐渐进入更多真实生产业务,这种由算力、模型和云基础设施共同驱动的变化,还将持续影响未来企业的IT架构和云资源选型。
kf@jusoucn.com
4008-020-360


4008-020-360
