Google 把时间序列预测玩成了大模型——TimesFM 深度解析
Google 把时间序列预测玩成了大模型——TimesFM 深度解析时间序列预测这个领域,终于也迎来了属于自己的"GPT 时刻"。 先说结论:这玩意儿能直接用,不用训练传统的深度学习预测模型,...
Google 把时间序列预测玩成了大模型——TimesFM 深度解析时间序列预测这个领域,终于也迎来了属于自己的"GPT 时刻"。 先说结论:这玩意儿能直接用,不用训练传统的深度学习预测模型,...
导读: 边缘这个词在物联网的世界里被赋予了新的定义,特指在设备端的附近,所以根据字面定义,边缘计算即在设备端附近产生的计算。2019年5G 概念爆发以后,边缘计算的概念也被迅速推广普及,在写作本文的这段时间里,凡和边缘计算沾边的上市公司股价均多日涨停,关于边缘计算的文章阅读量暴增几倍。...
谷歌这个开源项目,能预测任何行业的未来?跨境电商爆单预测、供应链库存优化、零售需求预测能源需求峰值(尤其是AI数据中心电力)、股票价格走势……..几乎所有时间序列数据,它都能预测。 就在几天前(2025-10-03),谷歌开源了最新的时间序列预测大模型TimesFM2.5,...
快速阅读:Google的TurboQuant算法被移植进llama.cpp后,MacBook Air(M4, 16GB)终于能在20000 tokens上下文下运行Qwen 3.5-9B,而此前直接崩溃。这不是什么颠覆,但确实把“不可能”变成了“可以接受的慢”。 ...
科技博主Avi Chawla在X上发了一条长帖,详细拆解了月之暗面Kimi团队刚刚发布的一篇技术报告。 帖子发出后不久,马斯克本人在下面回复了一句:“月之暗面做出了令人印象深刻的结果”(Impressive work from Kimi....
大模型越做越大,层数越堆越多。 但有一个问题一直没人正面解决:堆得越深,后面的层越来越不管用。 Kimi刚刚发了一篇论文,把这个问题挖出来,给出了解法,在自家48B大模型上验证有效,所有测试任务全部提升。 论文代码已开源: https://github....
快速阅读:Sebastian Raschka整理了从2024年初到2026年春天发布的40多个开源大模型的架构图谱。这些模型几乎都在做同一件事:想办法让注意力机制便宜一点、快一点、跑得更长,同时保住性能。收敛的是设计语言(MoE、QK-Norm、滑窗注意力成了标配),...
最近几年,大模型赛道好不热闹。 叫得上名字的几乎数都数不过来:从 GPT、Llama、Gemma、Mistral,到 DeepSeek、Qwen、Kimi、GLM、MiniMax 等等,新模型几乎以周更的速度出现。 但问题是,当架构创新越来越多时,理解它们反而变得越来越困难。...
在大模型的后训练(Post-training)阶段,如何通过强化学习(RL)进一步激发模型的推理能力,已成为当前学术界和工业界关注的焦点。然而,这一路径目前面临着核心矛盾:模型推理能力的上限往往取决于训练环境的质量,但构建既具备严谨验证机制又拥有大规模扩展性的推理环境正变得日益昂贵且困难。...
我尝试着用让你爷爷奶奶都能理解的方式来描述mHC架构。 如果想理解mHC,先要知道HC(Hyper-Connections);如果想理解HC,先要知道Residuals(残差);要理解Residuals,先要知道深度神经元网络(Deep Neural Network)。 所以,...