最近光通信行业出了个值得聊的新闻HyperLight在其TFLN Chiplet平台上推出了每通道400G的PIC。可能有人听到这串名词会绕晕但做AI基础设施、数据中心网络或者光模块的同行应该能立刻意识到这是在给下一代人工智能互连做关键铺垫。我不是HyperLight的人也没拿到内部PPT就以长期做高速光模块和硅光芯片验证的视角把TFLN、Chiplet、PIC、400G这几个词背后的技术逻辑和落地价值拆开讲讲顺便说点我们平时测试这类产品时踩过的坑。1. 为什么AI互连需要“每通道400G”1.1 AI集群的带宽焦虑先说说题眼里的“人工智能互连”。现在做大模型训练已经不是单卡算力的问题而是几千甚至几万张GPU、加速卡怎么高效协同的问题。一次百亿参数模型的梯度同步动辄要传几百GB甚至上TB的数据如果互连带宽不够整个训练集群的计算资源会被“饿死”GPU空转等数据的时间比真正算的时间还长。目前主流的数据中心光互连单通道速率是100G一个800G光模块需要8条100G并行通道。做到单通道200G的方案已经在批量爬坡但AI集群带宽需求涨得太快业界已经把眼光放在单通道400G上。只要每通道能跑到400G一个800G模块只需要2条通道一个1.6T模块只需要4条通道通道数量大幅减少光纤布线、连接器、PCB布局的压力都成倍缓解。1.2 单通道速率升级的价值单通道速率提升不是简单的“把车速从100km/h提到400km/h”那么爽快背后牵扯到一整套链路重新设计。但为什么大家宁愿调高单通道速率而不继续堆通道数量呢原因有几个第一是空间与密度的限制。光模块面板和交换机前面板的面积是固定的可插拔模块的尺寸规格也是固定的QSFP-DD、OSFP等。通道数翻倍意味着内部要放下更多激光器、调制器、探测器和驱动芯片热密度和布线难度都会失控。单通道速率翻倍是在同样的外壳里塞进更大带宽的最直接思路。第二是光纤和连接器成本。一个400G模块用2根光纤相比800G用8根单bit分摊的光纤、MPO连接器、理线和维护成本明显下降。在万卡集群里光纤用量是天文数字哪怕每根光纤省下几块钱乘以几万条链路也是相当可观。第三是功耗压力。每增加一个光学通道就要多一套激光器、调制器、TIA和驱动电路固定功耗是非常高的。通道数减半相当于把一套链路的整体功耗压缩直接贡献给液冷和电费账单。当然单通道提速也意味着调制器要承受更高的波特率光学器件的带宽、线性度、噪声指标全都得跟着升级。这就是TFLN这类新材料登场的背景。1.3 400G不是终点而是与1.6T的节奏行业里对光互连的路线图有一个大致共识在AI集群的scale-up超节点内部互联和scale-out跨节点互联两个场景中带宽密度需求会从当前的单口1.6T逐步走向3.2T甚至更高。每通道400G已经是绕不开的核心基础速率。可以这么理解400G per lane就像一块新的“砖头”未来无论做1.6T、3.2T都是用这些砖头拼接。如果这块砖头能做扎实后面整个互连架构的成本、功耗和密度都能受益。2. TFLN与Chiplet这套平台到底高明在哪2.1 薄膜铌酸锂材料红利的一次释放TFLNThin Film Lithium Niobate薄膜铌酸锂听起来是个新材料其实铌酸锂材料在光通信里用了很多年传统的铌酸锂马赫-曾德尔调制器LiNbO3 MZM是长距离相干通信的主力。但传统铌酸锂调制器有个致命弱点尺寸太大。几个厘米长的调制器根本塞不进可插拔模块里更别说和CMOS芯片做共封装。薄膜化的意义在于把铌酸锂晶体做成几百纳米厚的薄膜再通过干法刻蚀做出脊波导结构光学模式被压缩在极小截面内。同样的电光效应在薄膜结构下能实现更高的电场强度驱动电压可以降下来器件尺寸缩小到毫米甚至亚毫米级。为什么TFLN在400G这条路上特别有优势核心是带宽、插损和驱动电压三个指标一起满足标准硅光调制器的3dB电光带宽通常在30-50GHz做到70GHz以上要费九牛二虎之力而TFLN调制器的带宽做到100GHz以上相对轻松因为在铌酸锂晶体里电光响应本身快到近乎瞬时主要限制来自电极设计和微波损耗。铌酸锂的线性度极好chirp也低这意味着做PAM4这种多电平调制时信号质量更有保障。低驱动电压意味着可以用普通CMOS驱动器推动不用上高功耗的差分大摆幅驱动。当时我们第一次拿到TFLN样品时测试结果比硅光MZM在带宽和眼图质量上确实是代际差异这一点做实测的人会懂。2.2 Chiplet架构光芯片和电芯片的“专业分工”“Chiplet”这个词大家更多是在先进封装和CPU领域听到比如把计算核心、I/O die、缓存拆成不同小芯片再拼装。HyperLight把Chiplet概念搬到了光互连领域本质逻辑是一样的不要把光子集成电路PIC和电驱动芯片强行做到同一个工艺平台上因为两者对工艺的要求根本不同。光芯片要的是低损耗波导、高性能调制器适合用铌酸锂等特种工艺电芯片要的是高速晶体管和成熟的CMOS或BiCMOS工艺。如果强行把二者集成到同一个die上要么光性能妥协要么电性能妥协要么良率惨不忍睹。Chiplet化设计的意义就是让光子芯片和电芯片各自使用最优工艺流片然后再通过先进封装把它们集成到一个封装体内。这就带来几个实际好处光子芯片可以针对调制器、波导、探测器做专门的工艺优化不用迁就CMOS制造流程。驱动芯片、TIA、DSP可以用最先进的FinFET或SiGe BiCMOS工艺保持电学性能领先。每个die单独制造和测试可以分别筛选KGDKnown Good Die提升最终封装良率。2.3 PIC里面究竟整合了哪些功能一个面向400G每通道的PIC绝不仅仅是一个调制器那么简单。TFLN Chiplet平台上的PIC通常要集成TFLN调制器阵列、低损波导、分束合束器、监控光电二极管等无源和有源器件。调制器阵列是核心。因为400G链路中模块和交换机的接口往往还需要TIA、驱动、监控等PIC上集成若干通道的MZM或微环调制器可以形成一条完整的光发射链路。分束器负责把激光器输入的连续光均匀分给多个调制器通道功分比、相位一致性直接影响各通道的一致性。监控PD用来实时监测每个通道的光功率和偏置点配合外部控制环路实现自动偏置控制。这里有一个容易被忽略的细节偏置点控制。TFLN调制器虽然性能好但它的直流偏置也会随温度和电压漂移。因此PIC上必须集成足够多的监控和反馈通路让系统可以自动锁定最佳工作点。我们测试硅光微环调制器的时候最头疼的就是微环谐振峰随温度漂移需要额外加热器而TFLN的MZM没有谐振波长的强温度依赖在热管理上要省心得多但偏置控制回路依然必不可少。3. 每通道400G PIC的工程细节与关键参数3.1 调制格式与带宽预算一款PIC声称“每通道400G”它到底是怎么做到400Gbps的这个问题值得掰开揉碎讲。目前业界对400G per lane的调制格式还没有完全统一常见的有两类路径一类是在100Gbaud左右的高波特率下用高阶PAM调制另一类是利用偏振复用在同一波长上加载两个正交偏振态每偏振承载200Gbps。高强度调制IM/DD路线下400G per lane需要把波特率推到130Gbaud甚至更高级别否则就要用PAM6、PAM8这类高阶格式。TFLN恰好擅长高波特率它的电光响应平坦度高群延迟波动小在高频段不会像普通硅光调制器那样眼图快速劣化。也就是说TFLN给高阶调制预留了更多“信号裕量”。如果是相干或偏振复用路线400G可以是每偏振100Gbaud左右的16QAM或者每偏振200Gbps的PAM4。不管哪条路线调制器本身都需要以下几项硬指标3dB电光带宽至少要覆盖波特率的一半最好做到100GHz以上否则符号间干扰会吃掉眼图余量。插损要低典型TFLN调制器插损能做到2dB左右比硅光MZM有优势这直接贡献给链路预算。消光比ER要高PAM4需要至少5-6dB否则四个电平在接收端会糊成一团。回波损耗要小尤其是高频下如果S11反射太严重信号链路会被“回音”干扰。3.2 低电压驱动与封装互连TFLN调制器之所以能支撑400G级别的高波特率很大程度上得益于它的低半波电压Vπ。传统的体铌酸锂调制器Vπ要三四伏甚至更高驱动芯片需要输出很大的摆幅功耗和线性度都很难做。TFLN把Vπ做到1.5V甚至1V以内以后普通CMOS驱动芯片就能推动不再需要专门的高压线性放大器。封装互连是400G PIC里比芯片本身更容易翻车的地方。高频信号从驱动芯片输出经过封装基板、键合线wire bond或铜柱、再到调制器电极每一段都会引入寄生电感、电阻和电容。如果阻抗不连续高速信号会在这个接口上产生反射和损耗。实测中我们遇到过这样的情况调制器芯片本身带宽很高但封装后测出来的电光响应明显掉了几dB仔细一查是键合线过长、高频地回路面积太大。解决方向是尽量缩短互连长度用倒装焊flip-chip而不是wire bonding来连接驱动芯片和PIC或者把电芯片直接放在PIC的凹槽里chip-on-chip。Chiplet平台的意义之一就是把这种异质集成变成一个标准化、可重复的工艺模块而不是每个项目都从零开始瞎摸索。3.3 验收一个400G PIC时我关注的指标如果拿到一款号称“400G per lane”的TFLN PIC我会先看以下几个关键参数的实测数据而不是只看PPT上的曲线一是“带宽之外的光谱响应”——很多调制器在S21测试时看到100GHz带宽但群延迟和相位平坦性不好做调制时眼图照样劣化。我会关注群延迟波动是否在几个皮秒以内。二是“驱动与调制器联调后的真实眼图”——单独测调制器的裸眼光学响应是一回事配上驱动芯片后完整链路又是一回事。在100Gbaud PAM4下眼图是否干净、噪声是否大、四个电平之间的间距是否均匀这些更能反映实际可用性。三是“温度循环下的漂移”——TFLN的MZM对温度敏感性低于硅光微环但依然不能完全假设它不漂移。把PIC放进温箱里做-40到85℃循环记录每个通道的偏置点变化和ER劣化程度才知道系统里需要多少自动偏置控制的裕量。四是“寿命和可靠性”——铌酸锂本身的材料稳定性很好但薄膜化和刻蚀过程会不会引入缺陷封装应力会不会导致偏振相关损耗变化这些需要长时间老化测试和高温高湿测试来验证。光通信的产品光指标好看不算完能过GR-468和GR-1221才算真的能出货。4. 对AI互连的实际影响从模块到集群4.1 可插拔模块和CPO的落地方向每通道400G PIC对整个互连系统的影响最终会体现在两个落地方向上一是传统可插拔光模块二是共封装光学CPO。在可插拔模块这边400G per lane能让模块速率和外形规格快速匹配。比如一个OSFP模块支持4×400G就是1.6T的模块。相比今天8×200G的1.6T方案通道数量减半模块内部光纤布线和驱动电路数量大幅减少功耗和成本都能明显优化。CPO这边TFLN Chiplet平台的想象空间更大。CPO的本质是把光引擎直接封装到交换芯片旁边甚至和交换芯片放在同一基板上用极短的电互连代替模块和面板之间的长走线。这时候光引擎的体积、功耗和集成度就变得非常关键。TFLN调制器的小尺寸和低驱动电压让它有希望成为CPO光引擎的核心器件。AI集群未来后端网络scale-out对带宽密度的需求会超过传统数据中心对功耗更是极度敏感。CPO加上400G单通道的光引擎能够实现“光互连带宽翻倍但面板空间和电互连距离不变”的效果这才是TFLN平台在AI互连里真正施展拳脚的地方。4.2 功耗与成本账怎么算用一个非常粗略的账来看趋势当前数据中心800G可插拔模块的功耗大约在12-16W左右如果要升级到1.6T最理想情况是功耗涨幅控制在一个端口本身的增幅之外。但如果只是把四个800G模块堆到两台交换机上功耗直接翻倍液冷散热压力很大。如果采用400G单通道PIC用两通道做800G等于把链路里的固定通道开销减掉一半即使单通道速度提升带来一点额外DSP功耗整体每比特能耗还是能显著下降。驱动功耗是更明显的一块。传统调制器Vπ偏高驱动器需要输出很高的电压摆幅功耗自然下不来。TFLN的低Vπ让驱动电路可以工作在更低的电源电压和更小的摆幅下这省下来的功率在AI集群几万条链路里放大以后直接是电费和散热系统的差距。当然成本还有一个隐藏变量——制造良率。TFLN相比硅光最大的争论点在于衬底成本和工艺成熟度。铌酸锂单晶薄膜衬底的价格远高于SOI晶圆晶圆尺寸目前也偏小这对大规模量产是现实挑战。但Chiplet模式的妙处在于PIC的面积可以做得很紧凑一块小尺寸die上集成多通道400G调制器阵列单片成本可以被性能优势和集成度优势弥补一部分。4.3 时延敏感场景下的PIC Chiplet为何重要AI训练集群里有一个常常被低估的指标——互延时延。All-reduce之类的集合通信操作对时延极其敏感时延越高GPU集群在大规模并行训练时的同步效率越差。光模块链路中的时延来源很多包括PCB走线、DSP编解码、串并转换、光电转换和物理传输。传统模块架构里信号要经过交换芯片、重新定时器、DSP、驱动、调制器多级处理每一级都在积攒时延。CPO架构配合TFLN Chiplet平台可以减少DSP重新定时的环节或者至少缩短电信号在板卡上绕行距离把时延切成几个固定的、可预测的抖动预算。还有一点是互连故障恢复。AI集群规模越大链路故障越频繁。通道数减少以后光纤连接器数量变少单点故障的概率系数也随之下降。对整个集群运维来说这是一笔隐性的可靠性收益。5. 常见问题与选型避坑5.1 TFLN的良率、可靠性和成本问题每次我在圈子里提到TFLN用于400G互连紧接着就会有人问良率怎么样可靠性有没有验证成本能不能打说实话TFLN在过去几年确实经历了从实验室到小批量产的过程。薄膜铌酸锂晶圆的制备本身不是新事但高质量薄膜的均匀性和极低的波导侧壁损耗一直是量产难点。干法刻蚀铌酸锂的工艺窗口比较窄刻蚀深度、角度、侧壁粗糙度都会引入额外插损和相位误差这直接影响多通道一致性。如果项目里要选TFLN PIC我的建议是几件事不能省MTBF和老化数据不能只看芯片级必须看封装后的模组级数据温度循环测试要覆盖全工作范围不能只看常温晶圆批次间的Vπ和插损一致性统计分布要看否则大批量生产时每一批都要重新调偏置电压产线痛苦不堪。5.2 我在封装和测试里遇到过的三个坑第一个坑是射频互连的接地回路。TFLN调制器的电极通常是GSG结构如果驱动板上的地回路设计不当高频下地弹和串扰会直接反射到光信号上。我们第一次测样片时把探针台的地弹簧接的位置不太理想眼图在25GHz以上出现明显劣化找了半天才发现是探针接地位置离电极过远造成的。封装设计和PCB走线时严格控制地回路的面积和与信号路径的平行长度比单纯买更贵的连接器重要得多。第二个坑是光纤耦合方式的偏振敏感性。铌酸锂波导通常是TE偏振主导的如果激光器输入的光偏振不稳定或者偏振串扰超标插损和ER都会有波动。这个问题在模块集成阶段特别容易暴露因为激光器尾纤的偏振轴和PIC端面的耦合对准在温度变化时容易发生微小的机械漂移。做系统级测试时一定要在不开盖的情况下跑温度循环看不同温度下光口性能有没有“呼吸感”。第三个坑是直流偏置的自动控制。TFLN调制器的偏置点在外加电压和温度影响下会有漂移系统里如果没有一个响应够快的偏置控制环开机半小时后会发现眼图质量明显变差。这需要在PIC上设计合理的监控PD和功率参考通道还需要把控制器带宽设计得足够高才能跟上快速温变场景下的漂移速度。这一步在样片阶段不容易体现但在整机热循环测试时会暴露得非常直接。5.3 常见问题速查表问题可能的成因快速排查思路高频眼图迅速劣化封装互连阻抗不连续、驱动带宽不足先测TDR曲线再单独测驱动输出最后测电光S21插损高于预期波导侧壁粗糙、模场失配耦合、偏振不对分别测耦合损耗和波导传输损耗旋转偏振后对比温度漂移明显偏置点漂移、耦合点热位移温箱内测试热循环记录监控PD值变化趋势通道间一致性差波导分束不均、各调制器偏置不同测各通道ER和输出功率检查分束器设计长时间老化后衰减封装应力、湿度侵入做高温高湿老化监控插损和暗电流变化5.4 选型评估时看什么参数面对不同厂商的TFLN PIC我不建议只盯着最亮眼的带宽或最低的Vπ。400G per lane产品真正的竞争力体现是“带宽、插损、驱动电压、线性度、良率、成本”这几个维度有没有同时平衡好。带宽很高但插损太大的TFLN芯片在链路里容易被接收端灵敏度吃掉实际用起来得不偿失。Vπ压得极低但相位调制的线性度不足的做PAM4时会体现在电平间距不均匀上。另外还要关注PIC的边缘耦合方式和光纤阵列的匹配很多TFLN PIC设计成端面耦合edge coupler如果模场直径和实际光纤模场不匹配耦合损耗就会变成量产时的痛点。我会额外要求厂商提供小信号S21和眼图而不是只给大信号扫频曲线会要求看不同偏压下的ER曲线而不只是一张最佳工作点的照片还会要求明确晶圆代工厂和封装厂分别是谁因为同样的PIC设计在不同封装厂手里的最终性能可能有很大差距。6. 写在最后一点亲测体会TFLN不是我接触的第一个高带宽调制器平台但它是这些年里让我觉得“参数终于不打架了”的方案。之前做硅光MZM的时候带宽和驱动电压之间总是互相制约为了凑一个好看的眼图得反复调驱动、调偏置、调温控折腾得够呛。TFLN的头几次测试还真有点意外接了边电极测出来的高频响应平得让人几乎想再复查一遍探针校准。当然TFLN离大规模普惠还有距离晶圆成本、标准化工艺、可靠性数据积累都是接下来几年要补的课。但HyperLight这次把TFLN做成了Chiplet化的PIC平台并且直接对标每通道400G的AI互连需求等于把“新材料”和“新系统”之间的桥搭了起来。对我们这些做系统集成的人来说最大的好处就是不用再拿一堆裸芯片自己慢慢调射频和偏置而是可以拿到一个相对完整的PIC子模块来做集成和测试这比从元件级开始攒系统要省太多时间。如果手头正在预研1.6T甚至3.2T的AI互连方案我个人建议是尽早把TFLN纳入评估范围。先跑一轮温箱循环再做一轮驱动联调你会很快知道这套平台到底是真能落地还是又一个PPT黑科技。就我目前看到的情况来说它的底子是靠谱的接下来就看量产节奏和应用场景能不能跑得起来了。