ARTICLE / 虎嗅

这届AI PC,太烧心了

2026年10月10日 15:47 · 来自 虎嗅

阅读原文 → 收藏

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《这届 AI PC,太烧心了》 AI PC还没火,先被AI背刺了。 10月9日,技嘉宣布,旗下全部B760和H610主板将通过BIOS更新,支持预计2027年初推出的新款英特尔LGA1700处理器,其中赫然包括DDR4主板; 「新三年,旧三年,缝缝补补又三年」,DDR4的老树发新芽自然不是情怀作祟,而是成本与销量的双重夹击。 市场研究机构Omdia的估算显示,内存与SSD在PC物料成本中的占比,已从通常的约15%一路涨到接近40%。 与之伴随的,另一家市场研究机构IDC的初步数据则显示,2026年第三季度,全球PC出货量同比下降20.1%,寒意逼人。 就连号称「最佳AI PC」的Mac,也没能避开这股寒意,2026年第三季度出货量同样出现同比下滑。 当AI行业不断刷新性能天花板,PC厂商面前摆着一道越来越迫切的必答题:怎样让消费者还买得起一台普通电脑。 PC销量暴跌,都是内存惹的祸? 内存涨价的冲击波,并不是什么新鲜话题。 APPSO之前也提到,伴随着AI服务器对HBM和服务器DRAM的需求持续增长,存储厂商也开始将更多资源投向利润更高的数据中心产品,留给消费级内存的产能增长空间受到挤压。 产能一倾斜,价格最先给出反应。过去一年多里,内存与SSD的报价节节攀升,一路从采购端的报价单传导到整机的成本表上,原本只占小头的存储部件,如今成了物料清单里最大的吞金兽。 TrendForce以一款建议零售价900美元的主流笔记本为例做了测算:2026年第三季度,CPU、DRAM和SSD已吃掉物料成本约68%。 为此,过去几个季度,PC厂商已多次提价,但依旧没能完全填平成本的坑。尤其当消费者看到水涨船高的价格,很难不诞生让旧电脑再战几年的想法。 今年第三季度的出货滑坡,正是处在这样的背景。IDC的统计显示,全球PC出货量从去年同期的7850万台缩水至6270万台。 Omdia的统计也指向同一趋势:全球台式机、笔记本和工作站出货量同比下降21.2%。 不过,把这笔账全算在内存头上并不公平。这是多重因素叠加的结果。 一方面,去年同期的基数本就偏高。Windows 10停止支持引发的换机需求在2025年集中释放,抬高了对比的基准线。 另一方面,上半年的抢跑式备货打乱了下半年的节奏。 为了赶在内存进一步涨价前囤货,部分品牌和销售渠道提前加仓,一些原本属于后续季度的订单也随之前移。等到第三季度,高售价劝退了终端买家,渠道又得消化已有库存,寅吃卯粮之后,继续向厂商订货的劲头自然弱了。 更糟糕的是,一向由返校季带量的第三季度,因此没能等来惯常的旺季。 IDC分析师Jitesh Ubrani认为,库存压力或倒逼渠道促销,但价格想回到一年前的水平,恐怕开弓没有回头箭。 摆在厂商面前的无非几条路:继续涨价、自己扛下部分成本,或者降低配置、延长成熟平台的服役期。DDR4的重出江湖,正是这场取舍的产物。 The Verge的记者在近期采购内存时发现,一套32GB的Corsair Vengeance DDR5套装售价620美元,对应的DDR4套装只要260美元。单品报价虽不能代表整个市场,但360美元的差价,足以左右一次装机决定,一分钱难倒英雄汉。 DDR5在带宽和能效上技高一筹,DDR4也没能躲过这波涨价潮。然而对于手里已有DDR4内存的用户,旧内存继续上岗,就能省下一笔升级费用。 技嘉此次公布的兼容计划,恰好递上了这样一个台阶。LGA1700于2021年随第12代酷睿登场,平台原本就连着DDR4、DDR5两类主板两条腿走路。按照公告,现有B760、H610用户更新BIOS后,即可坐等后续处理器升级。 不过,两类内存需要对应的主板,不能在同一插槽里互换。公告也没有披露新处理器的型号、架构或实际性能,目前能够确定的是,旧平台将继续获得新产品支持。 AMD一侧,技嘉已于今年8月宣布新一批AM4主板,配合Ryzen 7 5800X3D的重新推出,为坚持DDR4的装机方案再添选项。 过去,新平台总爱把处理器、主板和内存升级打包出售,逼着用户整套换新。如今,能替用户保住多少现有硬件,反倒成了产品竞争力的一部分。成熟平台可以省下整套换新的支出,但已经买到手的电脑,还能不能老树开新花、承担更多任务?开源开发者正在从软件层面尝试回答这个问题。 跑千亿大模型,个人游戏PC也能螺蛳壳里做道场 最近,一个名为Strata的开源项目在GitHub上走红,累计获得约1.95万颗Star。 图|🔗https://github.com/Niko1221/Strata 它最大的亮点,就想让一台普通游戏电脑小马拉大车,驱动拥有1250亿参数的Qwen3.8-Flash-Next。 按照Strata项目公布的测试,一台配备RTX 5070显卡、12GB显存、Ryzen 5 7600处理器和64GB系统内存的电脑,在Q2_0量化配置下,回答生成速度可以达到每秒94 Token。 冷知识,94 Token/秒比普通人阅读速度快大约10倍。如果模型以这个速度实时输出文字,屏幕上的内容会像瀑布一样刷屏,你只能看到文字在滚动,根本来不及逐字读完。 如此大的模型能在消费级电脑上跑起来,秘诀在于让显存、系统内存和CPU各显神通,分担工作。 Qwen3.8-Flash-Next采用MoE混合专家架构,模型里住着一大群各司其职的专家模块,每次计算只点其中几位的将。总参数量虽大,生成每一个Token时却不必全员上阵,颇有杀鸡焉用牛刀的精打细算。 Strata正是吃透了这种稀疏性:高频使用的专家缓存在显存中,全部专家权重则保存在系统内存里。显卡负责核心计算,CPU并行处理没有缓存在显存中的专家,SSD则存放大型查找表。 对于用户而言,可以把它理解成给整台电脑重新排兵布阵:显卡干擅长的活,系统内存出大容量,CPU也参与推理,有限的显存不必再一个人扛下所有。 量化则进一步为模型瘦身。权重经过低比特压缩后占地更小,但压得越狠,回答质量越打折扣。 每秒94 Token对应的是项目中的Q2_0版本。同一套测试硬件上,压缩更温和的IQ3_S版本生成速度为每秒53 Token。鱼与熊掌之间,速度、内存占用和模型效果仍需取舍。 项目还采用了推测解码,让较小的辅助模块提前预测后续Token,再由主模型批量验证。按照开发者的说明,这项机制可以带来约1.6至1.8倍加速,其收益取决于预测被接受的情况。 需要注意,推测解码可以减少生成过程中的串行计算步骤,加快输出速度,却无法消除低比特量化造成的精度损失。 即便接受这些妥协,本地运行依然很「真香」。 按照项目说明,Strata支持聊天、编程和可选的图像输入,还能通过兼容API与应用、编程助手连接。推理全程在本机完成,给了用户云端调用之外的另一个选项。 不过,12GB显存只是入场券的一部分,系统内存同样决定体验成色。64GB内存装得下项目列出的多个2bit、3bit版本;32GB配置通常只能选精简的Coder版本,后者砍掉了部分专家,在中文等非编程任务上的能力也更弱。 首次启动时,项目需要把几十GB数据搬进内存,电脑可能卡上1到3分钟。长文本还需预先处理,默认请求也要排队完成。跑分之外,启动等待、多任务使用和回答质量,都决定它能否胜任日常。 启动等待、内存要求和回答质量上的取舍,意味着Strata距离日常好用仍有门槛。 但它展示了一种可能:同一套硬件,通过更合理地分配计算和存储任务,也能运行过去难以容纳的大模型。电脑能做多少事,除了取决于买了什么硬件,也取决于软件能把这些硬件用到什么程度。 换句话说,无论是本地软件挖潜,还是云端服务降价,获取智能的门槛都在变低。 也正是在这样的背景下,一个反差显得格外刺眼:知名风投机构a16z发布过一张引用高盛数据的图表,显示LLM价格指数用约三年,就走完了个人电脑价格指数约十五年的降价路。 智能服务越来越像一种廉价的数字快消品,承载智能的内存、芯片和计算设备,却仍然被产能与供需卡着脖子。于是,科技行业一边把更强的AI塞进普通人手里,一边又让普通人为一根内存条一分钱掰成两半花。 我们可能正迎来智能越来越便宜的时代,却也正在经历一场由智能需求亲手推高的硬件成本危机。把榨干每一分性能的规矩立住了,为这场AI繁荣买单的我们,才能不那么烧心。