系统内核

Rust + CUDA IPC:多 GPU 间零拷贝张量通信工程实战

大规模 AI 模型训练与推理离不开多 GPU 协作。本文深入讲解 CUDA IPC 机制如何实现在同一节点内多 GPU 间零拷贝张量传递,并通过 Rust FFI 绑定给出完整工程实现,覆盖内存共享模型、事件同步、NVLink 拓扑感知、错误处理与 NCCL 集成。

Ray 分布式计算引擎深度实战:从 Plasma 共享内存对象存储、Actor 所有权模型到 GCS 与分布式调度的工程全解

深入解析 Ray 分布式计算引擎三大基石:基于 Arrow 与共享内存的 Plasma 对象存储、所有权模型下的分布式引用计数与血缘重建容错、刻意保持轻薄的 GCS 控制面,以及自下而上的分布式调度与 Placement Group 资源预留。配合可运行代码与生产踩坑清单。

Trino 分布式 MPP 查询引擎深度实战:从 Connector 分片下推、动态过滤到分布式 Join 与容错执行的工程全解

深入剖析 Trino 分布式 MPP 查询引擎:从 Connector 三层 SPI 与 Split 分片下推、列式 Page/Block 字典编码、Broadcast 与 Partitioned Join 的代价模型取舍,到动态过滤(Dynamic Filtering)的运行时谓词反推机制,以及 Fault-Tolerant Execution 的 Exchange Materialization 与内存池化调优,给出生产环境的工程判断。

MPTCP 多路径传输协议深度实战:从内核实现到生产部署

深入解析 MPTCP 多路径传输协议——从协议架构、数据序列映射、Linux 内核路径管理器与调度器实现,到生产部署实战与 eBPF 监控。涵盖 MPTCP v1 (RFC 8684)、Apple Siri 生产案例、MPTCP vs MP-QUIC 对比、以及多链路聚合在 5G/边缘计算中的应用。