首页
学习
活动
专区
圈层
工具
发布
首页标签大模型部署

#大模型部署

我用 WorkBuddy 做了一次 API 账单审计:7 天 16,007 次请求,发现单次成本差 9.6 倍

老酸奶

行业与岗位:通用办公 · 成本分析(个人/团队 AI 费用管理) 使用产品:WorkBuddy(自建 Skill ×2 + 定时任务 ×1) 数据窗口:2026...

2000

Agent的state注入

用户12796739

这不是黑客炫技,是 TypeSafe 官方文档自己承认的缺陷 查证日期:2026-10-01 | 官方引文来自 TypeSafe AI 文档 jaggednes...

2300

接大模型 API 之前,这 5 个坑先看完

API老黑

做 AI 应用的朋友,先对号入座:接口明明通了,账单却悄悄涨了不少;Key 不知道什么时候被人薅走了;线上跑得好好的,突然一整片 429 报错。

2000

vLLM 和 Ollama 到底怎么选?从「一行命令跑模型」到「扛住千级并发」,这篇讲透

顺势而为

经常有朋友问:「我本地跑大模型用 Ollama,公司要上线服务,是不是也用它?」也有人反过来,「vLLM 这么强,为什么大家还用 Ollama?」其实这俩根本不...

2000

任务跑一半,API 突然报“对话超长“断流:我给 Agent 修的紧急逃生通道

Harvil

本文是我开源项目 codeAgent(终端 AI 编程智能体)的系列第 2 篇,每天讲一个里面真实用到的技术点,全部附源码。 仓库:https://github...

5200

用坤擎智能体搭一套企业级 AI 中

用户10918529

本篇是「坤擎智能体·三端实战」系列第 1 篇,聚焦 Web 后台管理 + 聊天门户。 下一篇讲移动端(微信小程序 / App),再一篇讲 PC 桌面客户端。

2600

类Jev项目Kev从入门到实战(5):如何训练:从数据构造到评测的完整管线

用户12796739

choice 的 label 是选项名,noul 是 true/false,score 是等级序号(从 0 起)。留 10–20% 做评测。

8110

类Jev项目Kev从入门到实战(3):优缺点:全部来自真实实测

用户12796739

以下每一条都有实测证据支撑,不是官方宣传口径。背景:诗歌领域知识图谱,5 个决策任务(作者归属 5 选 1、下一跳 5 选 1、朝代 5 选 1、体裁 5 选 ...

10210

类Jev项目Kev从入门到实战(4):安装使用:十分钟跑起来

用户12796739

Python 3.12 或 3.13 + uv(torch 尚无 3.14 wheel)。GPU 可选:CUDA ROCm Apple Silicon(ML...

10710

Gemini 4 Argon追平GPT-6 Astra,但还用不上

用户4447475

按 Artificial Analysis 的说法,这是 Google 7 个多月来第一个高于 Flash 级别的专有模型。

11910

大模型长期记忆系统设计:记忆压缩、去重、动态遗忘、时间衰减与冲突处理应用实践24.0

未闻花名

通用大模型都存在一个明显短板:上下文窗口有限。单次对话结束,超出窗口范围的历史信息就会丢失。想要实现长期对话、持续运行的AI智能体、自动化业务Agent,单纯依...

13810

我给自己创建的 AI 专家做了一套验收测试:4 道题、3 个陷阱、1 份评分表

四王爷

我在 WorkBuddy 专家中心创建了一个大模型能耗监控方向的专家——它基于我们团队公开的推理能耗实测数据集,回答"该不该量化"这类问题:给我 GPU 型号、...

10710
领券