一个专为语音生成模型设计的推理引擎
作者认为 TTS 服务不能直接照搬 LLM 服务的设计思路。文本模型通常关心 tokens/s、TTFT;而流式语音生成更关心两个指标:第一段音频多久出来(TTFP,time to first packet),以及后续播放过程中会不会断流。 所以,必须针对这些特点设计单独的推理引擎~ 项目还在早期阶段,能跑的模型主要是Qwen3-TTS
登录后可查看链接作者认为 TTS 服务不能直接照搬 LLM 服务的设计思路。文本模型通常关心 tokens/s、TTFT;而流式语音生成更关心两个指标:第一段音频多久出来(TTFP,time to first packet),以及后续播放过程中会不会断流。 所以,必须针对这些特点设计单独的推理引擎~ 项目还在早期阶段,能跑的模型主要是Qwen3-TTS
登录后可查看链接https://horace.io/brrr_intro.html 在优化深度学习程序之前,先判断程序到底被什么东西限制了。 作者把 GPU 上深度学习的耗时粗略拆成三个部分:Compute(计算)、Memory Bandwidth(显存带宽)和 Overhead(调度/框架开销)。不同瓶颈需要完全不同的优化办法。可以把 GPU 想象成一家工厂: GPU 的 Tensor Core / CUD
从零手写大模型系列博文:从理解模型如何推理,到学习模型如何训练。 地址:nano-ai.tech/articles/ 之前发过推理篇,现在训练篇5篇也完结了
能部署什么模型、速度如何、需要几台设备、多少量化都列出来了。 而且基本都是根据 DGX Spark的特性优化过的
登录后可查看链接www.makingsoftware.com/chapters/how-is-data-stored 文章介绍了计算机如何在不同层次上存储数据,重点解释了缓存、内存和长期存储之间的性能与容量权衡,以及它们底层的物理实现原理。
一键给中文文章加上汉语拼音,生成适合幼儿园至小学低年级儿童的注音读物。
登录后可查看链接地址:vtabbott.io/diagrams/deepseek-v41-flash/ 网站的作者 Vincent Abbott 用一种叫 Neural Circuit Diagrams 的表示法来画模型。里面大致是这样读的: ----“线”表示 tensor 的各个维度/axis; ----方框或图形表示 Linear、Softmax、矩阵乘法之类的运算; ----从左往右表示数据依次经过不
李博杰的《深入理解 AI Infra:量化分析与系统设计》跟着DeepSeek的DSec 论文更新了一下 本书从硬件约束和模型架构出发,量化推导 LLM 推理与训练系统设计。 这次更新的: “DeepSeek 的 Agent 沙箱平台 DSec 是《深入理解 AI Infra》一个很好的例子。跟我当年在微软用 FPGA 加速网络、Bing 搜索,在华为用 UB 去掉抽象层的开销一样,都是打破旧的
登录后可查看链接OpenMuse 是 CopilotKit 开源的一套个人 AI Agent应用框架,类似前两天Meta发布的Muse项目。 项目集成了 Gmail、Google Calendar、PDF 处理、任务委派、目标追踪和个人记忆等能力,并支持用户随时接管浏览器或终端。它基于 CopilotKit、AG-UI 和 React Native 构建,可运行在 Web、iOS 和 Android,支持接入 O
登录后可查看链接你专注的事物会重塑你的心智。如今推荐算法、AI垃圾与“末日刷屏”正劫持大众注意力,操控大脑认知。作者呼吁摆脱算法投喂,重拾阅读博客、订阅RSS等自主探索习惯,回归节奏更慢、内容有限却由自我掌控的互联网,夺回思维的主导权。
在线体验:poloclub.github.io/transformer-explainer/ Transformer Explainer 是一款交互式可视化工具,旨在帮助任何人学习基于 Transformer 的模型(如 GPT)的工作原理。它直接在您的浏览器中运行一个实时的 GPT-2 模型,让您能够用自己的文本进行实验,并实时观察 Transformer 的内部组件和运算如何协同工作以预测下
登录后可查看链接宾夕法尼亚大学Pranam Chatterjee老师开设的秋季研究生课CIS 6270《离散生成模型》公开了全套教学资源。课程从概率微积分与连续扩散/流匹配打底,系统推导离散状态下的生成理论,不仅吃透马尔可夫过程、离散扩散与单形流,还直接讲透离散流映射(Flow Maps)、奖励引导及薛定谔桥等前沿方向。全套内容以公式推导配合工程实现,主页会持续放出详尽课件、带完整解答的测试题及开源代码,想把扩散
文章介绍 Jev 背后的(可能的)数学原理:从偏好建模到概率校准 地址:di-zhang-llm.github.io/blog/what-is-rlcd-the-secret-behind-jev/ 作者认为,Jev 是把传统的 Reward Model(奖励模型)直接做成了产品:输入状态和候选动作,直接输出经过校准的决策概率。RLCD 则是它背后的训练思想。 RLCD≈多选偏好建模+概率校准
作者指出,仅按流程写代码的工程师实为“人肉代理”,拒绝AI无法避免被淘汰。代码编写已非瓶颈,执着于亲自动手毫无意义。开发者应放手让AI承担执行工作,把精力聚焦于业务判断、决定“构建什么”并解决真实问题,或借助省出的时间尽早谋划出路。
科技巨头未能在AI创新中领跑,根源在于传统部门分工割裂了知识边界,导致高密度人才陷入内耗与局部最优。前沿AI问题深度耦合无法预先拆解,亟需打破壁垒、依靠领军者的技术品味化繁为简并重塑激励。在AI时代,组织架构本身就是核心技术能力。
https://paper.seebug.org/3521 对 100 个大模型中转站的黑盒实测:19 项检测器覆盖基础能力、站点安全、模型一致性、响应完整性、服务稳定性五个维度,共形成 849 个模型—中转站测试组合。849 个测试组合中,135 个实际不可用(涉及 45 个站点),296 个存在至少一项模型真实性异常证据(涉及 75 个站点),110 个存在隐藏指令注入,239 个存在明显延迟
文章指出大语言模型(LLM)毫无真正智能,所谓的“推理能力”只是人类自发脑补的“主观验证”幻觉。RLHF等训练机制让模型意外复刻了江湖通灵师的“冷读术”——以看似自信的统计套话诱导用户对号入座,不仅误导了大众,甚至连开发者自己也深陷其中。
学习外语是一项全脑综合锻炼。它能利用神经可塑性改善大脑结构,增强“认知储备”与“认知韧性”,从而延缓认知障碍症发作。即便步入晚年、无需精通,持续探索与学习新语言的过程本身,就能有效激活大脑潜能,延缓大脑衰老。
wafer ai公司整理的资源列表,列表的组织顺序是:从单次推理请求开始,依次进入单块 GPU、优化后的内核、推理引擎和分布式系统。 核心列表采用原始论文、官方规范与文档、作者项目仓库,以及直接的工程实现工作。 该仓库提供了一条从单次模型请求逐步扩展到大规模生产推理的学习路线,主要分为六层: GPU 基础:CUDA 执行模型、线程与内存层次、编译流程、PTX 和机器码。 内核优化:矩阵转置、归约
登录后可查看链接彻底改变人生分两步: 点火启动:用对平庸现状的极致厌恶或战术压力作为强效燃料,强行破局; 持续巡航:严格净化信息与社交圈(输入),并通过“降门槛、设信号、给奖励”打造低阻力习惯闭环(输出),重塑身份认同,让自律成为自然本能。