python代码分析nginx访问日志 本人网站使用内网穿透分析结结果IP都是内网地址。 统计结果 总访问量641805独立IP数14最活跃IP192.168.1.29访问492948次访问高峰时段16时59997次图表已保存至C:/Users/czliu/Downloads/nginx_analysis.png代码importreimportpandasaspdimportmatplotlib.pyplotaspltfromcollectionsimportCounterfromdatetimeimportdatetime# 配置项你的日志路径 LOG_PATHrC:\Users\czliu\Downloads\access.log# # 辅助函数清理字符串中的无效字符defclean_string(s):ifisinstance(s,str):# 移除非打印字符和二进制数据return.join(cforcinsifc.isprintable())returns# 1. Nginx日志正则表达式通用格式# 匹配格式IP - - [时间] 请求 状态码 大小 来源 UAlog_patternre.compile(r(\d\.\d\.\d\.\d)\s-\s-\s\[(.*?)\]\s(.*?)\s(\d)\s(\d|-))# 2. 解析日志parsed_data[]withopen(LOG_PATH,r,encodingutf-8,errorsignore)asf:forlineinf:# 清理日志行中的无效字符clean_lineclean_string(line)matchlog_pattern.match(clean_line.strip())ifmatch:ip,time_str,request,status,sizematch.groups()# 清理各个字段ipclean_string(ip)time_strclean_string(time_str)requestclean_string(request)statusclean_string(status)sizeclean_string(size)# 处理时间dtNonetry:# 日志时间格式03/Jan/2025:12:34:56 0800dtdatetime.strptime(time_str,%d/%b/%Y:%H:%M:%S %z)hourdt.hour# 按小时统计except:hour-1# 提取请求方法和URLreq_partsrequest.split()methodreq_parts[0]iflen(req_parts)0elseUNKNOWNurlreq_parts[1]iflen(req_parts)1else/# 再次清理方法和URLmethodclean_string(method)urlclean_string(url)parsed_data.append({ip:ip,time:dt,hour:hour,method:method,url:url,status:int(status),size:int(size)ifsize!-else0})# 转为DataFrame方便分析dfpd.DataFrame(parsed_data)print(f日志解析完成总访问量{len(df)}条)# 清理数据iflen(df)0:df[ip]df[ip].apply(clean_string)df[method]df[method].apply(clean_string)df[url]df[url].apply(clean_string)# 3. 分析核心数据# 3.1 访问量TOP10 IPip_top10Counter(df[ip]).most_common(10)# 3.2 按小时访问趋势hour_countsdf[df[hour]!-1][hour].value_counts().sort_index()# 3.3 HTTP状态码分布status_countsdf[status].value_counts()# 3.4 请求方法分布method_countsdf[method].value_counts()# 4. 绘制综合图表2x2子图iflen(df)0:plt.rcParams[font.sans-serif][SimHei]# 解决中文乱码plt.rcParams[axes.unicode_minus]Falseplt.rcParams[text.usetex]False# 禁用LaTeXplt.rcParams[text.parse_math]False# 禁用mathtext解析防止反斜杠被误解析fig,((ax1,ax2),(ax3,ax4))plt.subplots(2,2,figsize(16,10))fig.suptitle(Nginx访问日志分析报告,fontsize18,fontweightbold)# 子图1TOP10访问IPifip_top10:# 清理IP地址中的特殊字符并限制长度clean_ips[]forip,_inip_top10:clean_ipclean_string(ip)# 限制IP显示长度避免过长iflen(clean_ip)15:clean_ipclean_ip[:15]...clean_ips.append(clean_ip)ax1.barh(clean_ips,[cntfor_,cntinip_top10],color#1f77b4)ax1.set_title(TOP10 访问IP,fontsize14)ax1.set_xlabel(访问次数)else:ax1.set_title(TOP10 访问IP,fontsize14)ax1.text(0.5,0.5,无数据,hacenter,vacenter)# 子图2小时访问趋势ifnothour_counts.empty:ax2.plot(hour_counts.index,hour_counts.values,markero,color#ff7f0e,linewidth2)ax2.set_title(24小时访问趋势,fontsize14)ax2.set_xlabel(小时)ax2.set_ylabel(访问量)ax2.grid(alpha0.3)else:ax2.set_title(24小时访问趋势,fontsize14)ax2.text(0.5,0.5,无数据,hacenter,vacenter)# 子图3HTTP状态码分布ifnotstatus_counts.empty:colors[#2ca02c,#d62728,#9467bd,#8c564b]# 确保标签是字符串且干净labels[str(label)forlabelinstatus_counts.index]ax3.pie(status_counts.values,labelslabels,autopct%1.1f%%,colorscolors[:len(status_counts)])ax3.set_title(HTTP状态码分布,fontsize14)else:ax3.set_title(HTTP状态码分布,fontsize14)ax3.text(0.5,0.5,无数据,hacenter,vacenter)# 子图4请求方法分布ifnotmethod_counts.empty:# 清理请求方法中的特殊字符并过滤掉无效方法clean_methods[]clean_values[]formethod,cntinmethod_counts.items():clean_methodclean_string(method)# 只保留有效的HTTP方法ifclean_methodin[GET,POST,PUT,DELETE,HEAD,OPTIONS]orcnt10:clean_methods.append(clean_method)clean_values.append(cnt)ifclean_methods:ax4.bar(clean_methods,clean_values,color#e377c2)ax4.set_title(请求方法分布,fontsize14)ax4.set_ylabel(次数)else:ax4.set_title(请求方法分布,fontsize14)ax4.text(0.5,0.5,无数据,hacenter,vacenter)else:ax4.set_title(请求方法分布,fontsize14)ax4.text(0.5,0.5,无数据,hacenter,vacenter)plt.tight_layout()plt.savefig(rC:\Users\czliu\Downloads\nginx_analysis.png,dpi300,bbox_inchestight)plt.close()# 关闭图表避免在非交互式环境中出现问题# 5. 打印关键统计print(\n 统计结果 )print(f总访问量{len(df)})print(f独立IP数{df[ip].nunique()})ifip_top10:print(f最活跃IP{ip_top10[0][0]}访问{ip_top10[0][1]}次)else:print(最活跃IP无数据)ifnothour_counts.empty:print(f访问高峰时段{hour_counts.idxmax()}时{hour_counts.max()}次)else:print(访问高峰时段无数据)iflen(df)0:print(f图表已保存至C:/Users/czliu/Downloads/nginx_analysis.png)else:print(图表无数据未生成)

相关新闻

最新新闻

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现 【免费下载链接】serenity The Serenity Operating System 🐞 项目地址: https://gitcode.com/GitHub_Trending/se/serenity 导读 本文以 getopt(3) 手册 为核心&a…

2026/9/25 12:45:43
轻量服务器还是ECS?大促云服务器选购与避坑实战指南

轻量服务器还是ECS?大促云服务器选购与避坑实战指南

每年大促节点,群里永远有人在问同一个问题:“38元的轻量服务器到底怎么抢?为什么我每次点进去都是已售罄?68元直购和99元的ECS我到底选哪个?”作为一个常年帮团队和自己采购云服务器的老用户,我太清楚这种纠…

2026/9/24 14:25:52
为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南

为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南

为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南 【免费下载链接】agents Multi-harness agentic plugin marketplace for Claude Code, Codex, Cursor, OpenCode, GitHub Copilot, and Google Antigravity 项目地址:…

2026/9/24 14:49:33
PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署

PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署

PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署 【免费下载链接】PaddleOCR Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between i…

2026/9/23 8:01:38
Spring源码解析:构造器注入的类型转换与候选匹配机制

Spring源码解析:构造器注入的类型转换与候选匹配机制

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 14:28:18
openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由

openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由

openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由 【免费下载链接】openai-agents-python A lightweight, powerful framework for multi-agent workflows 项目地址: https://gitcode.com/GitHub_Trending/op/openai-agents-pyth…

2026/9/24 11:09:24

日新闻

周新闻