一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!
部署多种模型共享 GPU 集群时,运维团队常看到的不是算力不足,而是算力浪费——一部分 GPU 持续跑在 80% 以上利用率,另一部分却在 30%-50% 之间...
ollama v0.32.4 已正式发布。本次版本围绕 Apple GPU 推理支持、投机解码草稿模型量化、Qwen3 MoE 解码兼容性和性能优化,以及 Ag...
痛点: 训练集群 MFU(Model FLOPs Utilization)约 45%-55%,低于头部厂商(65%+)。
7月的上海,WAIC 2026世界人工智能大会办了整整一周。展览面积首次突破10万平方米,1100多家企业带来3000多项展品。作为一个野生DBA,逛了一圈下来...
在人工智能、大数据分析与云计算主导的今天,算力(GPU/TPU)往往占据了技术讨论的聚光灯。然而,如果没有高效、可靠且高性能的存储子系统作为支撑,再强大的算力也...
7月22日消息,在GTC 2026正式发布之后,英伟达(NVIDIA)近日首次完整公开了Rubin AI GPU架构的技术细节。作为下一代AI数据中心平台的核心...
7月17日,2026世界人工智能大会于上海盛大开幕。国产GPU领军企业沐曦股份(688802.SH)此次在世博展馆和张江展馆设立两大展区。从芯片板卡、服务器的集...
2026年7月19日至20日,2026世界人工智能大会(WAIC 2026)在上海召开。国产GPU厂商天数智芯在此次大会上,正式发布新一代通用GPU旗舰产品天垓...
深夜爆更,Anthropic 联手 SpaceX 放出重磅炸弹。Claude Code 的五小时使用限额直接翻倍,峰值时段限制一并取消,API 速率大幅拉升。原...
长久以来,在大众认知中,高性能计算、人工智能训练与推理的核心算力担当都是GPU。无论是顶尖超算集群,还是大模型训练服务器,搭载大量GPU芯片几乎成为行业标配,G...
上一篇把工具、sandbox 和环境反馈接回了训练信号。本文继续看这个设计的代价:一旦 rollout 不再是单轮补全,而是长 prompt、长 respons...
随着大语言模型(LLM)、多模态模型以及 AI Agent 应用的快速发展,企业对于模型部署、推理服务、资源调度和基础设施管理提出了更高要求。传统单机部署方式在...
在 Windows 10 系统中,使用 AMD 经典老卡 RX580 运行 Ollama 大模型,无需复杂的 ROCm 或 CUDA 配置,借助 Ollama ...
腾讯科技(北京)有限公司 | 前端开发 (已认证)
曾经有那么一个时代,前沿 AI 研究是由"肉体计算机"在吃饭、睡觉、享受其他乐趣的间隙完成的,偶尔通过"组会"这一仪式,用声波互联的方式同步一下进展。那个时代早...
在硬件验证的工程实践中,GPU 压力测试是一个看似简单却容易被低估的环节。无论是新装机器的出厂验收、二手硬件的可靠性评估,还是长期运行后的散热系统健康检查,单一...