【大模型后训练专题】 LoRA微调原理及实现
前言 ✍ 在大模型后训练这条线里,大模型的参数量往往是几十亿、上百亿。SFT / RLHF / DPO / GRPO 这些“训练流程”本身固然重要,但如果用 全参数微调(Full Fine-tuning) 去做,显存和存储压力会非常大:为了能够减少训练参数,...
前言 ✍ 在大模型后训练这条线里,大模型的参数量往往是几十亿、上百亿。SFT / RLHF / DPO / GRPO 这些“训练流程”本身固然重要,但如果用 全参数微调(Full Fine-tuning) 去做,显存和存储压力会非常大:为了能够减少训练参数,...
Google 把时间序列预测玩成了大模型——TimesFM 深度解析时间序列预测这个领域,终于也迎来了属于自己的"GPT 时刻"。 先说结论:这玩意儿能直接用,不用训练传统的深度学习预测模型,...
导读: 边缘这个词在物联网的世界里被赋予了新的定义,特指在设备端的附近,所以根据字面定义,边缘计算即在设备端附近产生的计算。2019年5G 概念爆发以后,边缘计算的概念也被迅速推广普及,在写作本文的这段时间里,凡和边缘计算沾边的上市公司股价均多日涨停,关于边缘计算的文章阅读量暴增几倍。...
论文: https://arxiv.org/pdf/2405.11143v4 代码: https://github.com/OpenRLHF/OpenRLHF 这个仓库实现了各种RLHF算法,能够快速上手微调自己打LLM或多模态大模型,甚至支持MoE模型;...
May 7, 2026,昨天,我刷到 Hugging Face 上一个很离谱的模型: gpt-oss-20b-tq3 它本质上是 OpenAI 开源的 GPT-OSS-20B,被社区重新做了一层 TurboQuant 3bit 极限量化,...
谷歌这个开源项目,能预测任何行业的未来?跨境电商爆单预测、供应链库存优化、零售需求预测能源需求峰值(尤其是AI数据中心电力)、股票价格走势……..几乎所有时间序列数据,它都能预测。 就在几天前(2025-10-03),谷歌开源了最新的时间序列预测大模型TimesFM2.5,...
前面QLoRA主要在讲“怎么在全精度模型上优雅地加一个低秩增量 ΔW”。工业界真实场景里依然存在着两个很常见的问题: 显存实在不够,8B / 14B 模型都快撑不住了,LoRA微调依然爆显存,如何进一步解决? LoRA 只是往权重上“加一个低秩偏移”,...
如果你用 Claude Code 做过稍微复杂一点的开发,大概率都遇到过这些问题:上下文一重置,TodoWrite 就消失;工具调用一多,目标开始漂移;错误没有被持续记录,最后上下文越来越重,但真正有用的信息却越来越少。 这些问题并不是使用方式不对,...
Everything Claude Code 是由 Anthropic 黑客松冠军 Affaan Mustafa 创建的开源项目,提供了一套较为完整的 Claude Code 配置体系。其核心思路不是把 Claude Code 当作单一的编程工具,...
先说结论 — DeepSeek 挑了 OpenAI 发 GPT-5.5 的同一天发 V4 预览版。1.6T Pro + 284B Flash,都给 1M 上下文,权重直接 Apache 2.0 开源,API 当天上线。V4-Pro 输出单价 $3.48,只有 GPT-5....