ARTICLE · 1074844
AI芯片FT进入千瓦级:别只升级电源,先重做功耗、温控和测试插入点
9月1日,Teradyne为UltraFLEXplus发布三款面向AI和数据中心器件的新仪器。UltraVS64-HP单台可输出1280 A,四台并联可到5120 A,完整测试Cell的电流能力超过15000 A;UltraPort-PCIe6支持32 Lane、64 Gbps PAM4;UltraPin5000-EM的数据率为5 Gbps,并增加了向量存储和Scan加速能力。[1]这些规格指向同一个变化:供电、数字Scan和高速接口开始被压进更早的量产插入点。
另一端也在变。Cohu在SEMICON Southeast Asia 2026的技术报告中指出,AI器件功耗已经超过1000 W,温控系统既要承担稳态散热,也要跟上快速变化的负载。[2]7月,Amkor与NVIDIA签署多年先进封装与测试合作,开发重点包括高密度互连和下一代异构集成。[3]6月,Teradyne与Tokyo Electron公布KGD测试Cell,用UltraFLEXplus配合Prexa SDP分立器件探针台,在先进封装流程的多个节点筛选芯粒。[4]
把这些消息放在一起看,量产团队面对的不是“换一台更大的Tester”,而是测试边界重新划分:晶圆或切割后芯粒阶段要尽早提高Known Good Die置信度,封装后FT要确认供电、高速I/O和封装互连,系统级测试再覆盖启动、长向量和真实负载。三段都测同一套项目会拖垮节拍,三段各自为政又会留下覆盖空洞。
第一张表:把功耗写成测试步骤,而不是产品标签
“这颗芯片功耗1000 W”对程序开发帮助不大。量产程序需要的是逐项功耗预算:每个测试项的电压、峰值电流、持续时间、负载跃迁、并测数量、前后相邻项目,以及允许的电压跌落。平均功耗相同,10 ms的高电流脉冲和连续数秒的满载,对DPS、Load Board铜厚、Socket接触和温控头的要求完全不同。
建议先做一张测试序列功耗图。横轴是时间,叠加DPS电流、DUT功耗、关键电源轨电压和温度代理值。若某个Fail只在高功率项目之后出现,就把该项目分别放到冷机开头、稳定中段和热机末尾做A/B。结果随位置移动,先查热状态和供电恢复,不要马上改Limit。
发布程序时还要设置三类保护:电源轨瞬态跌落上限、单次高功率驻留时间、连续高功率项目的累计能量或冷却间隔。保护值应来自示波器、电流采样和温控数据,不要只抄DPS额定功率。仪器能送出1.5 kW,不等于Socket、板上电源平面和回流路径也能安全承受。
第二张表:给程序加一套热状态机
高功率AI器件很难用一个固定Soak Time解决。器件内部热点、封装表面温度、温控头设定值和冷却介质温度并不相等。Cohu给出的难点包括快速热响应、高热流密度和热点分布,这意味着“温控显示25℃”不能证明Die已经处于可重复状态。[2]
程序至少应区分四个状态:预置温度、稳定判定、带载测试、恢复冷却。稳定判定不要只看达到设定值,还要看一段时间内的温度斜率、DPS电流和关键参数是否同时收敛。若Handler或温控头能回读压力、流量、接触状态,也应一并保存。否则更换导热界面材料、清洁温控头或调整压合力后,良率变化很难追到原因。
高功率项目的排序也不能靠直觉。把所有大功率测试集中运行,切换次数少,但可能形成持续热积累;完全打散则会增加反复升降温和节拍。比较两种顺序时,至少看首颗与连续运行后的参数偏移、站间差、恢复时间和Fail重测方向。真正适合量产的顺序,是在节拍和热重复性之间找到可验证的平衡,不是曲线最平滑的那一版。
第三张表:把KGD、FT和系统级测试的责任写清楚
Teradyne与Tokyo Electron的方案采用分立器件探针台,在先进封装流程的多个节点做KGD筛选;Amkor与NVIDIA的合作则把高密度互连、异构集成和测试能力放进同一条开发路线。[3][4]对Chiplet产品而言,坏Die进入2.5D或3D封装后的损失更大,所以筛选要尽量前移。但早期插入点仍受接触数量、散热、并行度和测试时间限制,不可能照搬成品系统负载。
可以按失效成本分配覆盖。晶圆和切割后芯粒阶段优先拦截供电短路、静态电流、基础数字功能、高风险接口,以及能预测后续封装损失的项目;封装后FT补上HBM连接、高速链路、封装互连与额定功耗条件;系统级测试再验证启动序列、长时间真实工作负载和软硬件协同。每个项目都要写明“在哪一站测、为什么在这里测、上一站漏掉会损失什么、下一站是否重复”。
这套分法不要机械套到普通RF芯片。RF开关、PA或LNA的CP通常仍以Vbe、Beta、BV和漏电等DC项目为主,S参数、P1dB、NF和fT一般放在封装后FT。AI/HPC器件把更多数字与功耗筛选提前,是由Chiplet价值、封装成本和KGD需求推动的另一类测试架构。
新设备到站前,先做一次整链挑战
新DPS、数字通道或高频仪器到站后,最容易通过的是仪器自检,最容易漏掉的是Cell边界。上线前应准备冷机、稳定态和连续高负载三组挑战条件,记录电源轨跌落、温度超调、接触压降、测试时间和重测方向。再用已知边界样品跑旧程序与新程序A/B,确认新增能力没有悄悄改变原有判定。
如果这三张表还没建立,千瓦级ATE只会把问题测得更快:电源越强,热状态越难控制;接口越多,失效归属越模糊;KGD筛得越早,错误筛选的代价也越高。先把功耗预算、热状态和测试插入点写进程序版本与量产记录,再谈并行数和UPH,现场会少很多“同一颗芯片,换个顺序就Pass”的争论。