大模型量化与推理系统架构演进:从GPTQ精确校准到PagedAttention内存管理的全链路优化 大模型量化与推理系统架构演进:从GPTQ精确校准到PagedAttention内存管理的全链路优化,全面解析LLM推理加速的核心技术与工程实现。 模型微调 2026年09月20日 0 点赞 0 评论 41 浏览
大模型推理量化技术深度剖析:GPTQ/AWQ/GGUF与KV Cache工程优化 深入解析大模型推理中的量化技术:GPTQ基于Hessian矩阵的量化优化、AWQ激活感知权重量化、GGUF混合精度格式与llama.cpp生态、以及KV Cache的PagedAttention优化策略 模型微调 2026年09月21日 0 点赞 0 评论 35 浏览
LLM微调与推理部署实战:2026年LoRA/QLoRA/AWQ/vLLM/TensorRT-LLM全链路工程指南 面向AI应用工程师的LLM微调与推理部署全覆盖实战指南 模型微调 2026年09月21日 0 点赞 0 评论 30 浏览
2026年大语言模型微调与对齐实战:从SFT到RLHF再到DPO的工程化完整指南 2026年大语言模型微调与对齐完整实战指南:从SFT监督微调原理与数据构建、RLHF奖励模型训练与PPO优化、DPO直接偏好绕过奖励模型的技术推导,到LoRA/QLoRA参数高效微调、工程化部署与评估体系,全面覆盖LLM对齐技术栈的最新进展与生产实践。 模型微调 2026年09月22日 0 点赞 0 评论 70 浏览
2026年MoE架构大模型实战:万亿参数高效推理与微调全攻略 深入解析2026年MoE架构大模型的高效推理技术,从原理到实战,覆盖DeepSeek-V3、Qwen3等主流模型的优化策略。 模型微调 2026年09月23日 0 点赞 0 评论 34 浏览
大模型微调工程实践:LoRA变体与参数高效微调全景指南 2026年大模型微调工程实践全景指南,深入分析LoRA变体系列、多LoRA推理、训练基础设施简化策略和领域微调最佳实践。 模型微调 2026年09月23日 0 点赞 0 评论 36 浏览
AI基础设施开源2026:大模型训练与推理的完整工具链全景 全景式盘点2026年AI基础设施领域的开源项目生态,涵盖模型训练框架、推理加速引擎、数据管道和LLMOps平台的技术演进与选型指南。 模型微调 2026年09月23日 0 点赞 0 评论 30 浏览
多模态大模型的RLHF对齐优化:从DPO到KPO的演进路径与训练效率提升 深入分析多模态大模型对齐优化技术,从DPO到KPO的演进路径,探讨RLHF在多模态场景的局限性及工程实践方案。 模型微调 2026年09月23日 0 点赞 0 评论 28 浏览
大模型知识编辑与持续学习2026:参数高效微调、知识注入与灾难性遗忘工程实践 深入解析2026年大模型知识编辑与持续学习技术全景,涵盖ROME/MEMIT/GPT-Modify等知识编辑方法、LoRA-MoE/PISSA等参数高效微调技术、灾难性遗忘多层防护策略,以及企业级知识管理系统的工程实践。 模型微调 2026年09月24日 0 点赞 0 评论 40 浏览
LLM对齐与安全治理2026:从RLHF到宪法AI与自动化红队评测 深入分析2026年大语言模型安全对齐技术的演进路径,从RLHF成熟形态到宪法AI规模化应用,再到自动化红队评测体系 模型微调 2026年09月24日 0 点赞 0 评论 30 浏览
从云栖到骁龙:AI智能体引爆算力军备竞赛,DeepSeek公开Agent训练基础设施(2026年9月24日科技周报) 本周科技资讯盘点:2026云栖大会发布国产最强AI芯片真武V900,性能达上代3倍;高通骁龙峰会展示智能体AI PC生态;DeepSeek梁文锋署名论文公开Agent训练沙盒平台DSec;AICC大会发布智能体基础设施报告;联合国安理会聚焦AI安全治理 模型微调 2026年09月24日 0 点赞 0 评论 31 浏览
当大模型开始训练自己的下一代:2026云栖大会揭示RSI递归式自我改进革命 2026云栖大会揭示大模型自我进化革命:Qwen3.8-Max在人类零参与下完成33轮RSI迭代、推理框架自主优化提升96%、芯片物理设计面积缩减42%;阿里计划训练5-10T参数Qwen4/5;Agentic AI与RSI形成正反馈循环,AI研发从人工调参转向自主进化 模型微调 2026年09月25日 0 点赞 0 评论 43 浏览
LLM 后训练量化深度实战:从 GPTQ/AWQ 到 FP8 与 KV Cache 量化的显存-带宽极限工程 从 Roofline 模型定量证明 decode 阶段 Tensor Core 利用率仅 0.33% 的内存墙困境出发,系统拆解 LLM 后训练量化的完整工程栈:group-wise 量化粒度、SmoothQuant 的 outlier 迁移、GPTQ 的 Hessian 误差补偿、AWQ 的激活感知缩放、FP8 延迟缩放与 KV Cache 分级量化,并给出逐层重建误差定位法与生产选型决策树。 模型微调 2026年09月29日 0 点赞 0 评论 42 浏览
AI 模型量化技术深度实战:从 GPTQ 到 BitNet 的推理降本工程 2026年大模型推理成本已成为AI商业化落地的核心瓶颈。本文系统梳理从训练后量化(PTQ)到量化感知训练(QAT),再到1.58-bit BitNet的技术演进路径,结合工程实践剖析GPTQ、AWQ、SmoothQuant、GGUF等主流方案的原理差异与适用场景。 模型微调 2026年10月01日 0 点赞 0 评论 34 浏览
[2402.00159] Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research 学习资料 模型微调 2026年10月01日 0 点赞 0 评论 8 浏览