首页
学习
活动
专区
圈层
工具
发布

#LLM

智能体关键能力:LLM Evals 与生产级评估体系

老周聊架构

企业里把 LLM 和 Agent 真正用起来,最难的从来不是把它跑通。最难的是回答两个朴素的问题:它现在到底行不行,以及我改完之后有没有变差。确定性软件能用单元...

600

AnyJev护城河在校准

用户12796739

一个开源项目用六天时间证明:决策模型真正的壁垒,不在接口 查证日期:2026-10-01 | AnyJev 数据均为项目自报(GitHub README,Apa...

400

【第三部分:第一个 Agent 应用】14. 开发一个完整的企业知识助手:从 RAG 到 Agent

夫子

前面的文章,我们已经分别介绍了 Context Engineering、Function Calling、Structured Output、RAG、Agent...

500

聊天记录越长越贵:我的上下文压缩分了七层

Harvil

codeAgent 系列第 3 篇,每天一个真实技术点,全部附源码。 仓库:https://github.com/Harvil1/codeAgent

1800

SpringAI Function Calling 实战:让客服 Agent 调用工单系统

行者全栈架构师

摘要: 客服不能只会说"我帮您查一下"——要真的去查订单、建工单、转人工。本文用 SpringAI @Tool 注解实现 3 个客服工具(查订单/建工单/转人工...

4410

Agent的state注入

用户12796739

这不是黑客炫技,是 TypeSafe 官方文档自己承认的缺陷 查证日期:2026-10-01 | 官方引文来自 TypeSafe AI 文档 jaggednes...

4210

Meta:Context Language Models 能够原生管理自身上下文的语言模型

一个会写诗的程序员

作者:Rulin Shao1,2、Shannon Zejiang Shen3、Junjie Oscar Yin1,2、Yuetai Li1、Minheng Wa...

3500

SpringAI Advisor 链:客服对话拦截器与中间件模式实战

行者全栈架构师

摘要: 敏感词拦截、RAG 增强、日志记录、限流降级——这些横切逻辑要按顺序执行,散落在业务代码里不可维护。本文用 SpringAI Advisor 链实现中间...

8310

类Jev项目Kev从入门到实战(5):如何训练:从数据构造到评测的完整管线

用户12796739

choice 的 label 是选项名,noul 是 true/false,score 是等级序号(从 0 起)。留 10–20% 做评测。

11010

类Jev项目Kev从入门到实战(3):优缺点:全部来自真实实测

用户12796739

以下每一条都有实测证据支撑,不是官方宣传口径。背景:诗歌领域知识图谱,5 个决策任务(作者归属 5 选 1、下一跳 5 选 1、朝代 5 选 1、体裁 5 选 ...

11010

类Jev项目Kev从入门到实战(4):安装使用:十分钟跑起来

用户12796739

Python 3.12 或 3.13 + uv(torch 尚无 3.14 wheel)。GPU 可选:CUDA ROCm Apple Silicon(ML...

13210

用AI 花了2个月开发 H5 老虎机游戏的真实复盘

A小码哥

我花了近两个月的时间开发一款 lucky friut 的 slot game 累的够呛。

13810

GLM-5.2深度拆解:百万上下文+自研架构,国产长程工程模型突围

A小码哥

2026年6月16日,智谱正式发布旗舰大模型GLM-5.2,彻底补齐前代GLM-5.1短板:稳定可用100万Token上下文窗口、全赛道顶尖编码Agent能力、...

16610

GDPval-AA Elo:基于Elo评分的专家级任务评估

A小码哥

GDPval-AA(General-Development-Provability Assessment-Agentic AI)是由OpenAI于2026年1月...

13410

Windows 下 Claude Code 落地全指南:从安装配置到避坑优化

虫无涯

最近一直在用 Claude Code 做本地项目的代码重构、测试文档批量迭代,从最开始的环境搭建踩坑,到国内大模型对接、频繁的权限确认弹窗,再到后期长上下文卡顿...

13620
领券