零拷贝

Linux内核DMA-BUF显式同步与跨驱动缓冲区共享:从零构建零拷贝GPU计算管线

在现代AI推理管线中,数据搬运的耗时往往超过计算本身。CPU与GPU、GPU与GPU、存储与加速器之间的零拷贝数据共享,是突破性能瓶颈的关键。Linux内核的DMA-BUF子系统正是解决这一问题的核心基础设施,而显式同步机制(explicit fencing)则是保证多设备并发访问正确性的基石。本文将深入DMA-BUF的内部机制,从零实现一个跨驱动的零拷贝GPU计算管线。

Linux 内核网络栈深度实战:从 Socket 系统调用到 NIC 驱动的数据包旅程

Linux 内核网络栈完全实战指南:从一次 write() 系统调用开始,沿着数据的完整旅程——Socket 层、TCP 协议引擎(三次握手、拥塞控制 CUBIC/BBR、延迟确认/Nagle、接收队列)、IP 层路由 FIB Trie 与邻居 ARP 子系统、Qdisc 流量调度 fq_codel/HTB、NIC 驱动与 NAPI 高性能接收、RSS/RPS/RFS 多队列分发,到零拷贝 sendfile/splice/MSG_ZEROCOPY、XDP eBPF 数据面加速、io_uring 异步网络、epoll 高并发与 SO_REUSEPORT 多进程监听。涵盖容器网络调优、TIME_WAIT 优化与生产级抓包分析方法。