实习个人工作总结〔2026力荐〕

工作总结 实习工作总结 运维实习总结 2026-04-29

工作总结

这三个月蹲在机房,手上活儿主要三类:机柜布线验收、线上系统故障处理、还有拿热成像仪抓风扇。一共经手工单247件,突发故障23起。数字不算多,跟正式工比大概七成量——但每一件都自己过了手,不是跟跑。

说几件值得记下来的事。

数据库连接池泄漏那次,差点把人搞懵

那天周四下午,监控突然跳出大量HTTP 500,三分钟内核心交易库的连接数直接顶到配置上限的300%。我第一反应是被人打了,赶紧查防火墙日志,没有异常流量。然后登数据库show processlist,发现几千个Sleep状态的连接,全都来自同一台应用服务器。这现象我在文档里见过,但真发生在眼前,还是有点懵。

我喊了师傅过来。他瞥了一眼说:“你strace跟一下那个Java进程,看看调close的时候到底在干嘛。”我照做,发现JDBC驱动确实调了connection.close(),但底层socket没释放——驱动版本有bug,但更直接的原因是连接池的removeAbandoned没开。

我的处理步骤:先临时在MySQL端用pt-kill慢慢清理积压连接,不能一把全杀,怕把正常事务也干掉。同时改应用参数,maxWait从30000降到5000,开启removeAbandoned。前后45分钟,业务恢复。

事后我写了个草稿,标题叫《连接池泄漏排查步骤》,把show processlist抓Sleep、反查应用PID、strace跟踪socket状态这三步按顺序写清楚。师傅看过后改了半页纸,加上了“先确认不是慢查询积压”的判断分支,然后才发到团队文档库。现在回头看,那45分钟里我做错了一件事:一开始误杀了几个正常的后台任务进程,导致部分数据回写失败。复盘会上我主动提了,然后把“执行kill前先查trx_state”加到了检查清单第一条。

机柜散热异常,是我用手背先试出来的

那次例行巡检,我走到华北-02机柜前,习惯性用手背贴了一下服务器面板——比平时烫。再看温湿度计,29度,没到32度的告警线。但我记得师傅说过一句话:“风扇声音发闷比不转更可怕,温度爬坡比高温本身更值得警惕。”

我蹲下去听,第8台服务器的风扇确实有“嗡嗡”的低频声,不像正常的呼呼风声。去借了热成像仪,扫出来出风口68度,其他只有45度。下电、开盖、手拨扇叶——其中一个完全没阻尼感,轴承卡死。换上备用风扇,15分钟温度回到24度。

我跟师傅说想把所有服务器按运行时长做个预警表。师傅说行,你先拉数据。我从监控系统导出了每台设备的风扇、硬盘、电源的运行小时数,筛出超过3万小时的,一共23台。然后用Excel做了个简易寿命追踪表,每周一早上刷新一次,标黄超过2.8万小时的,标红超过3.2万小时的。这个表现在还在用,上个月提前换了另外8个风扇,没有一起是因为报警才发现的。

布线验收那次,我跟施工方拍了桌子

华东-03机柜组布线验收,施工方为了赶工期,把电源线和网线捆在同一根桥架上,间距不到10厘米。我拿卷尺一量,要求停工整改。对方项目经理说:“短期跑着没问题,正式电又不会干扰网线。”我直接翻开手边那本《数据中心施工验收规范》,把第4.3.7条指给他看:“强弱电间距不小于30cm,且必须垂直交叉。”还补了一句:“去年华北机房静电击穿网卡,起因就是捆在一起。”

他没再争,但脸色不好看。最后重排了所有线缆,多花了半天时间。师傅后来跟我说:“你较真没错,但下次可以先打个电话给我,我帮你去说。你一个实习生拍桌子,人家回去告你一状不值得。”我才意识到,坚守规范是一回事,怎么守住是另一回事。

也干砸过

有次凌晨值班,收到磁盘空间告警。我写了个清理日志的脚本,想着用find加-mtime删掉7天前的文件。结果路径变量里多了一个空格,脚本直接删到了根目录下的/tmp,把正在运行的一个临时文件干掉了,导致关联服务报错。虽然没造成数据丢失,但让同事爬起来重启了两个容器。

第二天我把自己写的脚本一行一行看了一遍,发现没有做任何路径存在性检查,也没有在任何脚本里用过绝对路径。后来我在每个脚本开头都加了三行:检查目标目录是否存在、检查目录是否为空、检查目录路径长度是否小于20个字符(防止变量拼接错误)。这个习惯现在还在用。

还有哪些没做好的

对存储系统是真的不熟。有一次SAN交换机链路拥塞,厂商发来一个脚本让我跑,我只知道照着敲,看不懂fcstat输出里哪一项是SFP模块光衰。师傅让我自己查手册,我翻了两个小时才搞明白。后来我在笔记本上抄了一张速查表,把常用命令和正常值范围贴在了显示器边框上。

Python脚本也是,能跑但经不起折腾。备份清理脚本里用os.listdir(),遇到权限不足的目录就直接崩溃退出。现在改成try加上logging,把异常写进日志而不是直接断开。

接下来要做的事

不分什么大计划,就三件具体的事:
- 每个月选一台旧服务器,从裸金属装到业务上线,全程手打命令,把每个报错信息截图存下来,弄懂为止。
- 把机房所有设备官方手册里的“故障处理”章节通读一遍,用两页A4纸整理出一份“急诊卡片”,按症状索引命令,放在机柜门上。
- 每次经手的故障,写一段“如果再来一遍,我能在5分钟内判断出根因吗”的自问自答,存成一个单独的txt。

实习期结束的时候,我交的不是什么高大上的复盘报告,就是这台笔记本里一堆乱七八糟的步骤草稿、脚本备份、还有几张手写的速查表。但这些都经过实战验证——不管是别人的教训还是自己的。

    需要更多的工作总结网内容,请访问至:工作总结

相关文章

最新更新

推荐访问

Copyright©2006-2026 职场范文网 zc530.com 湘ICP备2022000399号-8

声明:本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。