过去几年,衡量一家AI公司的方式很简单:有多少张GPU,训练了多少参数,模型跑到了多大的集群。
GPU数量几乎成了AI时代的钢铁产能指标,谁拥有更多GPU,谁就更接近未来。
但GPU买回来之后,事情才刚刚开始。一颗GPU需要不断从内存读取数据,需要与CPU交换指令,需要访问SSD中的模型和样本,还需要与机架里的其他GPU同步计算结果。任何一条链路跟不上,价值数万美元的加速器就可能停下来空转。
Microchip数据中心解决方案业务负责人Brian McCarson把GPU、CPU和DPU比作大脑的不同区域,把PCIe交换芯片、Retimer、时钟器件、内存控制器和存储控制器比作神经系统。
大脑决定系统能够思考什么,神经系统则决定思想能否顺利传递。
当AI从大模型训练转向大规模推理,产业竞争除了聚光灯下的GPU,还有不太显眼的互连、存储、时延和能源系统。
AI开始离开训练场
Brian McCarson把AI的发展划分为四个阶段。
第一个阶段是机器学习时代。早期系统依靠统计模型、规则判断和大量嵌套逻辑预测结果。2001年前后,他参与半导体工厂自动化,目标是让原材料进入工厂后,尽可能不经过人工操作便完成加工和出货。当时的自动化系统已经能够根据数据调整生产,但系统能力仍然建立在工程师预先规定的逻辑之上。机器可以优化流程,却很难生成规则的新能力。
第二个阶段是训练时代。深度学习把图像识别、视频分析和自然语言处理推向新的性能水平。GPU原本服务于游戏图形渲染,大规模并行运算能力后来成为训练神经网络的重要基础。模型参数增加,训练数据增加,GPU集群持续扩大,数据中心逐渐围绕训练任务重新设计。
ChatGPT完成了训练时代最重要的一次市场教育。生成式AI并不是在ChatGPT发布后才出现,但对话界面第一次让普通用户直接感受到大模型的能力。模型从研究机构和云服务商的后台走到消费者面前,训练投入也随之快速增长。
第三个阶段是推理时代。训练解决的是模型如何获得能力,推理解决的是模型如何使用能力。训练一个模型可能集中在某个数据中心完成,推理却要在客服系统、搜索引擎、办公软件、汽车、机器人、摄像头、工业设备和个人终端里。
训练的目标通常是尽快完成一次规模巨大的计算任务。推理面对的则是数量庞大、持续到达、彼此不同的请求。
训练更像修建一座大型水库,需要在一段时间内集中大量资源。而推理更像为一座城市铺设供水网络,需要同时服务无数用户,还要控制每一次响应的时延和成本。
推理时代,模型规模仍然重要,但单次查询成本、单位功耗完成的Token数量、首个Token响应时间、持续输出速度和系统并发能力,开始成为新的工程指标。
Brian McCarson认为,AI产业已经进入推理时代。而物理AI将是推理继续向现实世界延伸的结果。模型不再只运行在云端,而是进入汽车、机器人、工业机械和各类边缘设备,AI才真正获得作用于物理环境的能力。
推理正在改变数据流架构
训练和推理都需要GPU,却会给数据中心带来不同的通信压力。
大模型训练通常需要把大规模数据连续送入GPU集群。单次数据传输规模较大,计算过程相对规则,多颗GPU需要频繁进行参数和梯度同步。系统追求的是吞吐率,目标是让大量计算单元长时间保持高负载。
推理请求通常更加碎片化。比如用户输入一句话,智能体调用一次数据库,机器人上传一帧传感器数据,搜索系统读取一段向量,推理服务器返回若干Token。大量小数据包在CPU、GPU、内存和存储之间快速往返,单个数据包不大,调用频率却很高。
推理系统还可能同时运行大量不同模型。一个请求先经过语言模型,再调用检索系统、视觉模型或企业数据库,最后把多个结果组合起来。数据中心不再只是一组加速器共同完成一项训练任务,而是大量计算资源、内存资源和存储资源的动态组合。
PCIe交换芯片的重要性随之上升。
PCIe交换芯片并不是简单的“接口扩展器”。它需要管理多条高速链路,让CPU、GPU、网卡、SSD和各类加速器能够建立低时延连接,同时处理路由、流量控制、错误隔离、热插拔和多主机访问。
传统服务器往往围绕固定的CPU、GPU和存储配置设计。AI数据中心正在走向资源池化:GPU可以组成计算池,内存可以组成容量池,SSD可以组成存储池,再根据工作负载动态分配。
资源池化提高了硬件利用率,也把更大的压力转移到互连系统。
GPU是否足够快,不再只由GPU芯片本身决定。GPU能否持续获得数据,逐渐成为决定有效算力的关键。
迎接PCIe 6.0时代
Microchip在2025年推出了采用3nm工艺制造的Switchtec PCIe Gen 6交换芯片,最高支持160条PCIe通道、20个端口和10组协议栈。
PCIe 6.0把单通道传输速率提高到64GT/s。160条通道叠加后,交换芯片每秒需要处理超过10万亿次传输。
如此高的通道数量并不是单纯为了连接更多设备。一台AI服务器可能安装多颗GPU、多块NVMe SSD、高速网卡和专用加速卡。不同设备之间需要形成多条数据路径。GPU从SSD读取模型,CPU向GPU发送任务,网卡接收集群数据,GPU之间交换中间结果,所有流量都可能经过PCIe交换结构。
PCIe 6.0还改变了物理层和协议层的实现方式。PCIe 5.0及更早版本主要使用NRZ信号,一个符号表示一个比特。PCIe 6.0采用PAM4信号,一个符号可以表示两个比特,在不将符号频率翻倍的情况下可以把数据率从32GT/s提高到64GT/s。
PAM4把四个电压状态压缩到原来的信号摆幅中,相邻电平之间的距离更小,链路对噪声、串扰、反射和时钟抖动更加敏感。
PCIe 6.0因此引入FLIT传输模式和前向纠错机制。数据不再完全沿用此前可变长度的数据链路层处理方式,而是被组织成固定格式的流控制单元,再结合循环冗余校验和低时延前向纠错提高可靠性。
但是,PCIe每升级一代,PCB走线、连接器、背板和线缆能够支持的有效距离都会缩短。高频信号通过长距离走线后,插入损耗和码间干扰反而更加严重。
交换芯片一边要处理更高吞吐量,一边还要完成错误管理、设备隔离和安全控制。Switchtec Gen 6集成硬件信任根、安全启动和后量子安全能力,同时支持非透明桥接。
非透明桥接可以让多个主机域通过同一颗交换芯片连接,又保持各自地址空间和故障域相对独立。在多主机服务器、存储系统和资源池化架构中,非透明桥接能够避免一台主机直接控制所有设备,也可以降低某个主机故障对其他系统的影响。
让交换芯片替GPU“送快递”
传统交换芯片的职责是接收数据,再把数据送到指定端口。AI工作负载增加后,交换芯片开始承担一部分数据分发任务。
Brian McCarson在访谈中举了一个例子。假设GPU需要把同一份数据发送到十个存储位置。传统模式下,GPU可能需要生成十次发送操作,把数据分别写向十个目标地址,GPU却要重复执行数据分发。
Switchtec支持组播功能。GPU可以把一份数据和多个目标地址交给交换芯片,再由交换芯片完成数据复制与分发。GPU只需要提交一次任务,便可以继续执行模型计算,可以极大减少GPU参与低层数据搬运的时间。
AI加速器价格昂贵,功耗也高。让GPU承担重复的数据复制和通信管理,相当于让一名昂贵的研究员不断搬运文件。而通过交换芯片完成数据分发,GPU利用率可获得显著改善。
推理任务对组播和小包交换尤为敏感。训练集群经常传输大块张量数据,推理系统则存在更多小数据包和随机访问。智能体在运行过程中可能同时访问模型、向量数据库、用户上下文和外部工具,数据流向更加分散。
交换芯片从被动转发器件向可卸载部分通信任务的基础设施芯片发展。Brian McCarson将其形容为GPU的“智能助手”:不替GPU完成核心计算,只把GPU不应该浪费时间处理的工作接过来。
Retimer不是信号放大器
高速信号在PCB、连接器和线缆中传输时,会受到介质损耗、导体损耗、串扰和反射影响。传输距离增加后,数字信号的眼图逐渐闭合,接收端难以准确区分不同电平。
到了PCIe 6.0的64GT/s,PAM4信号包含四个电平,接收容限进一步缩小。主板上看似不长的一段走线,也可能成为链路设计瓶颈。
Retimer与普通Redriver存在本质区别。
Redriver主要对模拟信号进行均衡和放大。它能够补偿部分高频损耗,却会把输入信号中的抖动和噪声一并传递下去。Retimer会先接收并恢复数据和时钟,再重新生成一份符合协议要求的信号。输入端积累的抖动和失真不会原样传到输出端,链路相当于在中间重新开始。
Retimer内部通常需要完成时钟数据恢复、接收均衡、协议检测、链路训练和重新发送。处理能力越强,系统能够支持的PCB走线、线缆和连接器组合越灵活,但Retimer本身也会增加功耗和时延。
Microchip在2026年推出面向PCIe 6.0和CXL 3.1的XpressConnect Retimer,支持64GT/s,单颗器件可提供32条通道,引脚到引脚时延低于12ns。
低时延对CXL尤其重要。CXL建立在PCIe物理层之上,但应用重点不仅是连接外设,还包括CPU、加速器和内存之间的一致性访问。服务器可以通过CXL扩展内存容量,或者让多个计算设备访问共享内存资源。
存储设备访问慢几纳秒,影响可能并不明显。内存访问原本就在纳秒尺度上,链路中每增加一级Retimer、交换芯片或协议处理,都会进入系统时延预算。
Retimer既要延长传输距离,又不能把内存扩展的性能优势消耗在链路时延上。
AI服务器主板越来越复杂,GPU、CPU、CXL内存和NVMe SSD不可能全部紧贴在一起。PCIe交换芯片负责建立拓扑,Retimer负责保证每一段高速链路的信号完整性,两类器件共同决定数据能否稳定、低时延地流动。
GPU的真正敌人,是等待数据
数据搬运最容易被忽视。计算单元只有在数据已经到达时才能工作。GPU等待内存、等待存储、等待网络和等待其他GPU同步的时间,都不会体现在芯片标称算力中。
一颗GPU拥有再多计算核心,如果模型权重和输入数据不能及时送达,实际利用率仍然可能很低。
Brian McCarson用了一个很形象的比喻:把法拉利V12发动机装进一辆普通家用车,未必能够发挥发动机性能;即便整辆车都换成法拉利,如果道路遍布坑洼,同样跑不起来。
AI数据中心过去把主要预算放在“发动机”上。GPU迭代速度远远快于内存、存储和互连,系统瓶颈开始从计算单元向数据通路迁移。
PCIe交换芯片、Retimer、CXL控制器、NVMe控制器和高速时钟器件承担的任务,是减少GPU等待数据的时间。
在这其中,时钟器件尤其容易被忽略。数十条乃至上百条PCIe高速链路需要稳定的参考时钟。时钟抖动会直接侵蚀高速串行链路的采样窗口。速率越高,单位比特时间越短,系统留给抖动的余量越小。
Retimer能够恢复时钟,却不能解决所有时钟架构问题。服务器仍然需要低抖动时钟发生器和扇出缓冲器,为不同PCIe端口提供满足规范的参考时钟,并控制跨板卡、跨背板环境下的相位噪声。
GPU集群表面上是算力系统,底层实际是一套由计算、存储、互连、时钟和电源共同组成的精密机器。
是Token账,也是时延账
推理时代不会把所有计算都留在数据中心。
智能摄像头识别人脸时,可以把每一帧图像上传云端,再等待模型返回结果。云端模型能力更强,却会带来网络传输、服务器计算和持续Token调用成本。
摄像头也可以把少量人脸特征和小型模型保存在本地。设备发现人员进入视野后,直接在端侧完成识别,只把异常事件上传。
边缘推理减少了云端流量,也缩短了响应链路。
汽车、工业机器人和生产设备对时延的要求更严格。车辆不能在遇到障碍物后,把传感器数据上传数据中心,再等待云端决定是否制动。机器人抓取物体时,控制环路也不能依赖不稳定的公网连接。
云端更适合完成模型训练、复杂知识处理和大规模数据分析。边缘设备更适合完成高频、低时延、数据范围相对固定的推理任务。
亚马逊Alexa早期的设计已经体现了类似思路。设备在本地识别唤醒词,并处理部分高频、简单的语音信息。用户说出唤醒词的时间,也为设备启动和连接云端争取了时间。复杂请求交给云端,本地系统负责即时响应和基础判断。
训练与推理并不是二选一,云端与边缘也不是二选一。真正的架构问题,是把每一类工作放到最合适的位置。
当前云端AI服务价格较低,企业容易把大量流程直接绑定在某一家模型平台上。Brian McCarson认为,部分价格建立在平台厂商补贴和争夺市场的阶段性策略上。随着基础设施投资和Token消耗持续增加,云端调用价格未必长期维持在当前水平。
企业如果把全部业务流程设计为实时调用外部大模型,未来可能面对成本上涨、服务迁移和数据治理压力。边缘推理和私有化推理不仅解决隐私问题,也为企业保留了成本控制能力。
计算最终要重新靠近内存
推理时代的另一个变化,可能发生在计算和内存之间。
传统计算机采用相对分离的处理器和存储体系。CPU或GPU负责计算,DRAM负责保存运行数据,SSD负责长期存储,数据则通过总线不断传输。
处理器性能持续提升后,数据搬运逐渐占据更大比例的时间和功耗。
大模型推理尤其依赖内存带宽,模型权重需要从内存送入计算单元,长上下文和中间状态也需要反复读取。计算核心增加后,如果内存带宽没有同步增长,更多计算单元只会一起等待。
Brian McCarson从生物系统中寻找参照。人脑没有把计算和记忆分别放在两个相距很远的器官中,神经元的连接结构既参与信息处理,也承担记忆形成。语言、运动和视觉等功能由不同脑区完成,每个区域的计算能力都靠近相关信息。生物系统经过长期演化,把计算与记忆放在相近位置,以减少信息搬运消耗。
半导体产业正在探索近存计算和存内计算。近存计算把处理单元放到内存附近,减少数据跨芯片、跨板卡传输的距离;存内计算则尝试直接利用存储阵列完成部分运算。
两条路线都在解决同一个问题:不要让数据为了参与一次简单计算,就穿过一整套复杂的互连系统。
但是,数据中心仍然需要PCIe和CXL。近存计算并不会消灭互连,反而会重新划分互连承担的工作。局部、高频的数据处理可以在靠近内存的位置完成,跨设备、跨资源池的任务继续通过高速交换结构传输。
边缘AI可能更早采用相关架构,边缘设备不需要容纳数千颗GPU,也不需要保存超大规模训练数据。较小的模型、相对固定的任务和严格的功耗限制,为计算与内存紧密集成提供了更清晰的工程边界。
AI的终极目标将是物理AI
模型可以快速复制,数据中心不能。芯片需要晶圆厂生产,服务器需要机柜安装,数据中心需要钢材、混凝土、冷却系统和输配电网络。即便半导体产业能够生产足够多的GPU,建筑和能源系统也未必能同步完成扩张。
数据中心功耗增加后,问题从芯片散热延伸到城市电网,电网需要稳定的发电能力和输电能力。太阳能和风能能够提供低碳能源,却存在间歇性,需要储能和调度系统配合。核电能够提供稳定基荷,但审批和建设周期远长于AI芯片的迭代周期。
芯片平台一年更新一次,发电厂和输电线路不可能一年建成一代。AI产业前半场解决了“机器能不能思考”,后半场需要解决“现实世界能不能供养机器思考”。
答案不会只来自更大的GPU,还要来自更低时延的Retimer、更高密度的PCIe交换、更合理的内存层级、更靠近终端的推理、更高效的数据搬运,以及能够承受数据中心负荷的电力系统。
GPU仍然是AI计算的核心,却不再是唯一的主角。
当模型进入汽车、机器人、工厂和亿万台终端,决定AI能否规模化落地的,不只是大脑有多聪明,还要看神经系统是否足够快,记忆能否及时抵达,以及整个身体有没有足够的能量继续运行。
AI助手进入Microchip
Brian McCarson在2025年初加入Microchip时,数据中心业务正在经历一场调整。
疫情期间形成的库存问题、产品延期和客户支持压力叠加,部分项目落后原计划数年。更棘手的问题是,数据中心产品迭代节奏已经改变。
过去一代服务器平台可能拥有数年的生命周期。NVIDIA把AI平台升级节奏压缩到接近一年一代后,配套芯片供应商也必须同步更新。
Brian McCarson把产品发布日期比作奥运会。运动员可以调整训练计划,却不能要求奥运会因为自己没有准备好而延期。产品必须在客户平台导入窗口到来时完成,同时不能以牺牲质量为代价。
Microchip正在把内部文档、产品规格、工单、客户问题和历史解决方案整理为企业知识库,再利用大模型进行检索、归纳和内容生成。工程师可以让AI整理规格书初稿、生成客户问答、检索类似问题,或者分析多年积累的客户工单。过去需要员工翻阅大量文档才能发现的规律,AI可以在更短时间内给出候选答案。
Brian McCarson把AI称为员工身边的“博士级助手”。
博士级并不等于永远正确。大模型可能产生错误,也可能忽略关键上下文。Microchip的原则是,AI可以提出建议,不能替代工程师完成最终决策。人负责确认事实、审核结果和承担责任。
“企业AI的价值不在于把十名员工减少到一名,而是给十名员工每人配备一台推土机。”
一家公司可以用AI压缩组织,也可以用AI扩大现有团队的产出能力,两种方式都可能改善短期财务数字,只有后一种方式能够提高长期产品竞争力。