用普通笔记本跑大模型,不再是梦
快速阅读:Google的TurboQuant算法被移植进llama.cpp后,MacBook Air(M4, 16GB)终于能在20000 tokens上下文下运行Qwen 3.5-9B,而此前直接崩溃。这不是什么颠覆,但确实把“不可能”变成了“可以接受的慢”。 ...
快速阅读:Google的TurboQuant算法被移植进llama.cpp后,MacBook Air(M4, 16GB)终于能在20000 tokens上下文下运行Qwen 3.5-9B,而此前直接崩溃。这不是什么颠覆,但确实把“不可能”变成了“可以接受的慢”。 ...
科技博主Avi Chawla在X上发了一条长帖,详细拆解了月之暗面Kimi团队刚刚发布的一篇技术报告。 帖子发出后不久,马斯克本人在下面回复了一句:“月之暗面做出了令人印象深刻的结果”(Impressive work from Kimi....
大模型越做越大,层数越堆越多。 但有一个问题一直没人正面解决:堆得越深,后面的层越来越不管用。 Kimi刚刚发了一篇论文,把这个问题挖出来,给出了解法,在自家48B大模型上验证有效,所有测试任务全部提升。 论文代码已开源: https://github....
快速阅读:Sebastian Raschka整理了从2024年初到2026年春天发布的40多个开源大模型的架构图谱。这些模型几乎都在做同一件事:想办法让注意力机制便宜一点、快一点、跑得更长,同时保住性能。收敛的是设计语言(MoE、QK-Norm、滑窗注意力成了标配),...
最近几年,大模型赛道好不热闹。 叫得上名字的几乎数都数不过来:从 GPT、Llama、Gemma、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax 等等,新模型几乎以周更的速度出现。 但问题是,当架构创新越来越多时,理解它们反而变得越来越困难。...
快速导读:一篇在技术圈引起热议的帖子,揭示了一个普遍的误解:很多人以为自己电脑跑本地大模型卡顿是硬件不行,但大量一线玩家的真实经验是,仅仅把启动器从流行的Ollama换成更底层的llama.cpp,性能就能白拿30%以上的提升。你以为的硬件瓶颈,很可能只是工具瓶颈。 ...
背景 近几年,我一直从事于Agent领域的探索、应用与实践,也陆续沉淀了许多相关的技术文章,相信不少朋友都读过我之前那篇《如何构建和调优高可用性的Agent?浅谈阿里云服务领域Agent构建的方法论》。在那篇文章中,我们从Agent的概念起源聊到落地挑战,再到具体的解决方案,...
GitHub OCR项目之王刚刚历史性易主。 诞生近40年、统治OCR领域的技术标杆Tesseract OCR,被中国开源拉下王座—— 百度文心衍生模型PaddleOCR以73300+Star,正式登顶GitHub全球OCR项目榜,终结谷歌Tesseract OCR长期霸榜局面。...
你肯定听过编程界的一句名言:不要重复造轮子。如果我们把精力投入到重复做前人已经做好的工作,那确实是一种极大的浪费。不重复造轮子,却应该知道轮子是怎么造出来的。 今天我们推荐的项目就是教你如何去造”轮子“,去自己实现一些热门技术, 在GitHub超过234K Star的神作,...
1. LiteLLM快速使用 github:https://github.com/BerriAI/litellm https://docs.litellm.ai/docs/ LiteLLM 是一个 Python 库,旨在简化多种大型语言模型(LLM)API 的集成。...