首页
学习
活动
专区
圈层
工具
发布

#gpu

量化到底省不省电:2023–2025 大模型推理能耗研究综述

四王爷

一句话版本:这是一个吵了三年的问题,答案从"省"变成了"取决于"——而"取决于什么",恰好是 2025 年最有意思的进展。本文整理 2023–2025 年约 3...

2501

我给自己创建的 AI 专家做了一套验收测试:4 道题、3 个陷阱、1 份评分表

四王爷

我在 WorkBuddy 专家中心创建了一个大模型能耗监控方向的专家——它基于我们团队公开的推理能耗实测数据集,回答"该不该量化"这类问题:给我 GPU 型号、...

5210

量化 LLM 推理真的省电吗?我在五张 GPU、四代架构上直接测了测

四王爷

做 LLM 部署的人大多有个默认假设:量化降低了显存占用和内存带宽压力,所以推理更省电。这个假设在论文和工程实践里被反复引用,但真正直接测过的很少——大部分"量...

7610

晨会投屏黑屏30秒,老板的沉默比KPI更吓人

用户9494160

事情是这样的。周一晨会,轮到我讲方案,笔记本接上会议室的HDMI线——屏幕一闪,然后黑了。投影仪显示"无信号"。我按 Win+P 切复制模式,没用;拔插HDMI...

22031

量化的 LLM 不一定省电:我把结论拆成了六个可单独引用的工件

四王爷

做 LLM 推理优化时,多数人默认"权重低比特量化 = 省电"。我用 NVML 直接读功耗测了一轮后发现:低于某个模型规模的交叉点,NF4 反而更费电;而且这个...

10411

AGX Orin部署大语言模型实战教程

匠行科技

① 部署过程中需要安装各种工具及下载大语言模型,确保AGX Orin 已经连接到了互联网。查看方法:控制台ping baidu.com。

9610

秒剧:腾讯云GPU算力跑AI短剧渲染全链路工程迁移

用户12770587

12710

腾讯云GPU算力跑秒剧AI短剧渲染:团队从一周一集到一天三集踩坑复盘

用户12770587

12810

秒剧实战:腾讯云GPU跑AI短剧渲染,选型半年重解「文生视频」与「一键成剧」边界

用户12770587

19910

腾讯云GPU算力跑AI短剧渲染:秒剧出海成本从15万打到8000

用户12770587

33710

AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略

dongdonglog

聊并行之前得先知道敌人是谁。训练时一个参数要占多少字节?混合精度 + AdamW 的标准配置下:

27120

AI Infra 系列 · 第六章 GPU 性能工程(三):torch.compile 不是开关——碎算子能快一倍,GEMM 基本白搭

dongdonglog

同一个 torch.compile,A 快了一倍,B 基本没动。这就是本篇全部内容的缩影:编译器省的是开销,不是算力。算子越碎、Python 胶水越重,能省的越...

23420

飞书+Hermes可以做什么?

用户12724357

飞书已经成功连接到的Hermes Agent后,就想看看它到底可以给我做些什么,做到物尽其用。

14410

让 2013 年的 GTX TITAN 跑本地 LLM — Kepler 架构 GPU 复活记

用户8140185

GTX TITAN :2013 年旗舰卡,Kepler 架构(GK110),算力 3.5(sm_35)。 NVIDIA 在 CUDA 12.0 起彻底移除了对 ...

11910

ComfyUI 部署教程:云端 GPU 文生图工作流搭建

克劳德2048

摘要 ComfyUI 以节点连线的方式编排图像生成流程,相比一体化界面更灵活,适合需要精细控制生成过程的创作者。本文在一台带 GPU 的云服务器上完成 Comf...

59710
领券