自由和开放源代码的类 UNIX 操作系统
显存占用 4390 MiB,nvidia-smi 能看到,日志一片正常。然后第一次提问:
周一早上接到发布窗口的告警时,跳板机 bastion-a 的 SSH 连接是绿色的,目标服务器 db-prod 却一直超时。很多人第一反应是再试一次密码,或者把...
Cgroups(Control Groups)是Linux内核的"资源配给制"。没有它,Docker无法限制容器CPU,Kubernetes的ResourceQ...
PCRE (Perl Compatible Regular Expressions)是一个Perl库。Nginx rewrite 依赖于 PCRE 库,所以需要...
一句话总结: 在 RockyLinux 8 上用 GCC Toolset 14 + OpenMPI + OpenBLAS + FFTW 编译 CP2K-2026...
用命令搜索日志中的错误是极为常用的场景,但是过程特别痛苦。很多运维老兵面对这种场景也是用vi打开日志,一页一页往下翻,一个一个日志找。效率低,而且累。今天就教大...
一句话总结: 在 LEEHPC 集群 GPU 节点部署 Ollama + Open-WebUI,通过管理节点 Nginx 反向代理实现多用户统一入口访问大模型,...
在很多技术团队的认知里,Linux运维工程师的形象往往与“7×24小时待命”“背锅侠”“重启大法”联系在一起。这其实是一种相当滞后的职业定位。
我们采用轻量级Golang consumer,直接将Kafka消息批量写入ES,避免了Logstash的JVM开销:
传统的“重启大法”和“重装系统”在云原生环境下愈发无力。云服务器的本质是物理机资源的超售与隔离,这意味着你不仅要面对物理硬件的极限,还要对抗 Hyperviso...
某日早上 8:00 流量洪峰到来,业务方反馈 Nginx 504 大量涌现,健康检查间歇性失败。重启 Nginx 后瞬间恢复,但 10 分钟后再次复发。
作为一名 Linux SRE,我们每天面对的是成百上千台服务器、复杂的微服务架构以及瞬息万变的业务流量。性能调优和故障排查是 SRE 最核心的两项能力,它们不仅...