从智能体循环到底层推理栈:哈佛AI系统新课CS2680
多数AI课程往往局限于提示词工程或纯上层应用,哈佛这门《现代AI系统》则选择纵向贯通软硬件全栈。课程不设期末考试,全靠实操驱动:从体验Claude Code、构建多智能体协作循环,一路延伸到底层推理服务中的批处理调度、前缀缓存复用、量化以及推测解码。依托充足的GPU算力,学生通过五轮大作业亲手搭建并调优整套系统栈。无论做模型服务基建还是智能体落地,这份公开的教学大纲与前沿阅读清单都很值得翻阅。cs
多数AI课程往往局限于提示词工程或纯上层应用,哈佛这门《现代AI系统》则选择纵向贯通软硬件全栈。课程不设期末考试,全靠实操驱动:从体验Claude Code、构建多智能体协作循环,一路延伸到底层推理服务中的批处理调度、前缀缓存复用、量化以及推测解码。依托充足的GPU算力,学生通过五轮大作业亲手搭建并调优整套系统栈。无论做模型服务基建还是智能体落地,这份公开的教学大纲与前沿阅读清单都很值得翻阅。cs
MIT的公开课 微型机器学习与高效 AI 计算 26年秋季版更新了。还会学习如何在笔记本电脑上部署和运行大语言模型 地址:hanlab.mit.edu/courses/2026-fall-65940 本课程主要聚焦于高效机器学习(Efficient Machine Learning)与机器学习系统(ML Systems)。 这是一个至关重要的研究领域,因为深度神经网络需要消耗极其庞大的计算资源,
地址:rea.tools/blog/touhou-reconstruction/ 作者 N0zoM1z0 通过使用 AI Agent 重建三款《东方 Project》游戏的经历,探讨 AI 如何从根本上改变逆向工程的工作方式。逆向工程正在从依赖个人经验的手工业,转向由 AI Agent 自主探索、自动化验证工具把关、代码仓库持续积累知识的工业化生产模式。
https://glinscott.github.io/how-machines-learned-precision/ 一篇把机械可视化做的非常精美的文章。 精密制造是如何从零开始的? 现代工业依赖高精度机床制造精密零件,但这里存在一个循环:制造精密机器需要精密零件,而制造精密零件又需要精密机器。 本文以工业革命为背景,回顾了人类如何从依赖工匠经验和手工加工,逐渐建立起精密加工、测量和标准化体系,
如果你有或者要买DGX Spark ,可以看看这篇文章:The DGX Spark Handbook 地址: https://huggingface.co/blog/exolabs/the-dgx-spark-handbook 一篇面向本地大模型用户的实战手册,作者基于自己从 1 台扩展到 4 台 NVIDIA DGX Spark 的使用经验,讨论它适合什么、不适合什么,以及如何部署、组网、量化和
做平面设计时如果常被AI画面的文字乱码困扰,inclusionAI推出的Ming Image 0.1 Design很值得上手试试。这个模型专门面向图形设计场景,强项是在生成的画面里精准排布清晰可读的文字。它完全基于文字提示词生成,不支持参考图输入,画面尺寸也由模型自主规划,传入自定义比例会直接报错,支持导出PNG、JPEG与WebP格式。目前它已在OpenRouter上开放免费调用,拿来做海报草案
不过一些脑洞还是震惊到我,比如这个用SQL来玩Doom的 https://cedardb.com/blog/sqldoom/ SQLDoom 的核心思路,是把 Doom 的游戏世界和状态全部存进关系表:地图、玩家、怪物、血量、位置、武器等都变成数据,原本 C 里的循环和状态机则改写成 JOIN、UPDATE、聚合和窗口函数。整体思路很像 ECS:游戏逻辑不再逐个对象执行,而是一次处理一批满足条件
https://skywt.cn/blog/apple-typography-details “每隔一段时间,我就会逛逛 Apple 官网。Apple 作为人机交互的规则制定者,它的网页实现有太多值得我们学习和借鉴的地方。本文中,我梳理了一部分排版细节(并且在看源码的过程中又发现了一些新的细节 😂) ”
地址:cme295.stanford.edu/ 今年的课件和教学视频都在逐步公开中。讲师是一对双胞胎兄弟Afshine Amidi和Shervine Amidi。(所以特意打了不同颜色的领带来方便区分嘛[允悲]) 本课程深入探讨 Transformer 架构与大语言模型(LLM)的世界。您将学习自然语言处理(NLP)方法的发展历程、Transformer 架构的核心组件,以及这些组件如何与大语言
OpenAI 公布了一批由内部前沿模型推导出的数学新成果。这次发布参考了普林斯顿高等研究院数学与 AI 独立顾问组的规范建议,所有成果已整理至 GitHub 仓库,并制定了论文修订与引用机制。其中不少证明直接给出了 Lean 语言的形式化代码,支持由计算机完成严格验算。为了保证研究透明度,团队还同步公开了 10 份模型的完整推理摘要与尝试统计,平均每个结论耗费相当于 ChatGPT Pro 深度思
https://www.canva.com/design/DAHXJy7MerE/IkE4Ri9hWWNOnxz6azJTKg/view 网页链接 内容涵盖了预填充 vs 解码、MoE vs 密集模型、VRAM vs 统一内存、量化到推测性解码,所有内容都基于 llama.cpp
斯坦福 CS329Z《Engineering AI Agents》把 Agent 开发拆成一条工程学习路线:先亲手实现检索、工具调用和运行循环,再理解框架如何组织这些组件,最后用数据和评估判断系统有没有进步。 2026 年秋季首课是 9 月 23 日,适合已经有 NLP 基础、想系统学习 Agent 工程的人。 1、先学会拆系统,才能定位失败 课程首课阅读材料来自 Berkeley 的 Co
https://kernel-recipes.org/en/2026/schedule/swap-and-memory-reclaim-squeezing-out-more-ram/ 腾讯Kairui SONG的分享: 在 Linux 内核社区中,更高效地利用物理内存是一项持续且长期的工作。为了实现这一目标,社区投入了大量精力,包括将冷数据卸载和压缩、缓存与淘汰文件缓存等。交换(Swap)和内存
斯坦福这门CS329A《自我改进型AI智能体》把Agent自主进化的技术栈理得很透。课程从测试时算力扩展与过程验证讲起,贯穿强化学习训练与多步规划,一直延伸到代码执行反馈、长程记忆架构及具身智能。主讲团队还邀来DeepMind、Reflection AI与Physical Intelligence等一线团队的研究者分享实操经验,学术视野与工程落地兼备。想吃透推理期计算与自主决策底层逻辑的朋友很适合
https://david.alvarezrosa.com/posts/optimizing-a-lock-free-ring-buffer/ 网页链接 “ 单生产者单消费者(SPSC)队列是约束如何推动设计优化的绝佳范例。在本文中,你将学习如何从零开始实现一个环形缓冲区:从最简单的设计起步,使其具备线程安全性,然后逐步消除开销,同时保持 FIFO 行为和可预测的延迟。该模式广泛应用于超低延迟环境
gfxcourses.stanford.edu/cs149/fall25/lecture/ 课程主题是 Parallel Computing(并行计算)。课程从为什么现代计算机必须并行开始,一路讲到 CPU、GPU、CUDA、深度学习加速器、数据中心、缓存一致性、无锁编程等。可以把它理解成一门连接“计算机体系结构 + 高性能编程 + AI 系统”的课程。
https://horace.io/brrr_intro.html 在优化深度学习程序之前,先判断程序到底被什么东西限制了。 作者把 GPU 上深度学习的耗时粗略拆成三个部分:Compute(计算)、Memory Bandwidth(显存带宽)和 Overhead(调度/框架开销)。不同瓶颈需要完全不同的优化办法。可以把 GPU 想象成一家工厂: GPU 的 Tensor Core / CUD
从零手写大模型系列博文:从理解模型如何推理,到学习模型如何训练。 地址:nano-ai.tech/articles/ 之前发过推理篇,现在训练篇5篇也完结了
www.makingsoftware.com/chapters/how-is-data-stored 文章介绍了计算机如何在不同层次上存储数据,重点解释了缓存、内存和长期存储之间的性能与容量权衡,以及它们底层的物理实现原理。
地址:vtabbott.io/diagrams/deepseek-v41-flash/ 网站的作者 Vincent Abbott 用一种叫 Neural Circuit Diagrams 的表示法来画模型。里面大致是这样读的: ----“线”表示 tensor 的各个维度/axis; ----方框或图形表示 Linear、Softmax、矩阵乘法之类的运算; ----从左往右表示数据依次经过不