系统内核

Erlang BEAM 运行时深度工程实战:从归约计数抢占式调度、每进程分代 GC 到软实时与分布式容错的全链路解析

沿真实工程链路拆开 Erlang BEAM:为什么归约计数(reduction counting)把抢占从内核时间片变成可预算的语言语义,per-process 分代 GC 如何让暂停时间与系统总内存解耦,dirty scheduler 与 NIF/Port 该如何选型以避免拖垮调度器,以及 refc binary 泄漏、选择性接收 O(n) 扫描、无背压消息队列等生产陷阱与监督树容错策略,并给出可直接落地的 VM 调参清单与排障路径。

大模型分布式训练并行与显存工程实战:从 ZeRO 分片、FSDP 扁平参数到激活重计算与通信重叠全链路

沿真实工程决策链拆解大模型分布式训练:先算清混合精度 AdamW 的 16 字节/参数显存账本,再区分 DP/TP/PP 三种并行各自解决的维度,深入 ZeRO 三级分片与 FSDP FlatParameter 编排(含 70B 在 64 卡上的单卡显存实测表),给出选择性激活重计算的算力-显存兑换率与 use_reentrant 陷阱,最后落到 prefetch、bucket 与梯度累积 no_sync 的通信-计算重叠实战。