首页
学习
活动
专区
圈层
工具
发布
首页标签第四期热点征文-大模型技术

#第四期热点征文-大模型技术

RTX4090适配ChatGLM3-6B本地私有化部署:前后端分离构建对话服务实战项目19.7

未闻花名

今天我们从应用的角度构建一套完整可落地的一体化项目,基于原生Transformers实现推理,FastAPI搭建高性能后端,配套独立美观Web前端面板,同时内置...

1400

大模型命名后缀解析:看懂参数、量化、蒸馏、微调标识,快速筛选适配本地模型19.6

未闻花名

最开始刚接触本地跑大模型时每次逛Hugging Face、ModelScope找权重,同一个基础模型能拉出十多个版本,后缀一串字母数字堆在一起,完全摸不着门道。...

7110

随机森林结合大模型处理医疗表格数据,实现高精度建模搭配大模型医学文本归因19.5

未闻花名

做医疗数据分析、AI辅助诊断应该都会遇到两个非常棘手的问题:一是纯表格结构化病历数据,只用大模型直接训练精度拉胯,数值、检验指标、分级特征很难被大模型精准捕捉;...

9510

RTX4090单卡跑32B参数模型实践:4bit量化+Transformers与vLLM双方案部署差异19.3

未闻花名

最近一直被32B环绕洗脑,本着体验和探索,核心思路就是聚焦实操体验与深度模型探索,抱着说干就干的落地心态,直面大模型本地部署的现实算力难题。当下开源大模型里,3...

43332

跨病种共病关联挖掘:高血压 + 糖尿病 + 肾病,混元大模型因果推理疾病关联分析实践19.2

未闻花名

在日常慢病临床与健康大数据场景里,高血压、2 型糖尿病、慢性肾病从来都不是单独存在的疾病。很多患者先是血压升高,长期代谢紊乱诱发血糖异常,久而久之肾脏微血管持续...

10020

单卡4090显存优化实践:模型单卡分片加载、推理链路拆解、延迟与吞吐平衡调优19.0

未闻花名

基本我们做大模型推理落地、本地私有化部署,都会遇到一个非常头疼的现实问题:手握RTX 4090显卡,显存规格足够强悍,却依旧跑不动千亿、百亿参数级别的大模型。

16010

大模型激活函数迭代演进:SwiGLU替代传统ReLU/GELU激活逻辑提升模型性能18.9

未闻花名

在前一期《大模型主流激活函数解析:ReLU/GELU/SwiGLU 原理差异,拆解 FFN 前向逻辑》内容中,我们已经系统认识了神经网络激活函数的基础作用:线性...

18310

大模型主流激活函数解析:ReLU/GELU/SwiGLU原理差异,拆解FFN前向逻辑18.8

未闻花名

很多刚接触大模型微调、模型结构分析、推理优化的同学,第一眼看到 Transformer、FFN 前馈网络、SwiGLU、GELU、ReLU 这些名词都会觉得很抽...

17811

大模型参数规模拆解:十亿百亿千亿模型能力差异,结构配比决定AI智能上限18.7

未闻花名

相信我们做大模型应用实践过程中,一直都有一个根深蒂固的认知:大模型参数越多,智商就越高,效果就越厉害。于是行业也疯狂卷千亿参数、万亿参数模型,让大众也默认参数越...

27312

FlashAttention、PagedAttention两代注意力算法,改写大模型推理生态详解18.6

未闻花名

大模型能够实现流畅对话、长文本理解、多轮交互应答,核心底层完全依靠自注意力机制。但早期原生Transformer注意力,天生带着算力与显存双重致命缺陷,序列长度...

15210

词嵌入Embedding:Token离散转连续向量规则、RoPE特性、微调适配实践18.5

未闻花名

如果接触过大模型调用、或从事AI应用开发的工程师,基本天天都和Embedding打交道,分词Token、向量检索、语义匹配、RAG知识库、大模型对话生成,处处都...

20220

大模型幻觉本质:源于Transformer架构天生固有缺陷 + RAG根治方案参数调优18.4

未闻花名

不知道大家是不是也一样,做大模型应用做的久了,回过来头来总结思考,一直都有一个误区:总觉得大模型胡说八道、编造事实的幻觉问题,改改代码、修修bug、优化一下推理...

36321

揭秘大模型通用8192维度奥秘:千亿大模型为何统一采用8192隐层维度的真相18.3

未闻花名

经常接触大模型、应用过模型权重配置的朋友一定会发现一个特别有意思的现象:不管是国内主流开源大模型,还是其他通用对话大模型,不管是7B、13B、70B还是更大参数...

32721

大模型竞争持续升温,企业数字化转型提速

我的建站日记

如果说2023年是大模型的“诞生元年”,那么2026年无疑是其“落地决战之年”。从百模大战的野蛮生长,到如今头部阵营的格局初现,大模型赛道的竞争非但没有降温,反...

9210

大模型超长上下文显存控制:原生注意力缺陷、长文本显存暴涨原理与优化实践.180

未闻花名

大模型上下文长度,简单来说就是模型单次对话、单次推理能够记住并处理的文本总Token数量。早期开源大模型普遍只有4K、8K上下文,只能处理短篇对话、简短文档、小...

63455

RTX 4090显存终极优化:模型分层加载、CPU Offload显存和内存动态置换实践17.9

未闻花名

大语言模型的显存占用,是所有优化的核心起点。对于搭载24GB显存的RTX 4090,我们首先要明确:模型本身、推理计算、中间张量、上下文窗口,是四大显存消耗源头...

23721

基于OpenCV人脸检测与DeepFace视觉识别实现情绪抓拍、数据分析智能研判系统17.8

未闻花名

由于长期深耕青少年心理健康相关工作,在日常情绪疏导、心理状态观测中积累了大量实践经验,深刻意识到青少年情绪细腻多变、外在表达含蓄,很难通过简单交流精准捕捉真实内...

22110

大模型应用两大经典限流算法:漏桶算法vs令牌桶算法铸就大模型流量治理基石.177

未闻花名

限流算法是用于控制请求处理速率、保护服务资源的标准化算法,是所有流量管控策略的底层核心。在大模型服务中,算法的作用不再是简单限制请求数量,而是精准管控GPU 算...

23220

全新服务器大模型部署进阶:RTX 4090显卡驱动安装与模型运行容错适配指南.176

未闻花名

前面我们已经完整讲过全新服务器从零搭建、部署运行大模型的全套流程,今天咱们就在这个基础上,继续往下做关键一步:给服务器配置独立显卡,打通 GPU 硬件加速能力。...

29011

新服务器从0到1完整部署实践:openEuler环境搭建ChatGLM2大模型完整流程.175

未闻花名

玩过Linux服务器部署的都知道,这事特别熬人、格外劳心,尤其是碰上特定定制版本的Linux系统,各种环境兼容、配置坑点层出不穷,稍有不慎就卡死报错,出于习惯,...

18710
领券