国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:魏旭,成卫青
单位:南京邮电大学 计算机学院,江苏南京210023南京邮电大学 计算机学院,江苏南京210023东南大学 计算机网络和信息集成教育部重点实验室,江苏南京211189
关键词:恶意网页;网页安全;网页特征;HTTP请求;机器学习
基金:计算机网络和信息集成教育部重点实验室课题(K93-9-2014-04B)和国家自然科学基金(61170322)资助项目
互联网高速发展的同时催生了众多恶意网页。恶意网页是指侵犯用户安全,包括个人隐私和财产等安全的网页。文中基于对若干恶意网页的传统网页特征:网页URL、JavaScript代码和HTML代码的分析,定义了若干特征用于恶意网页识别;提出了若干基于HTTP请求信息的特征;并提出了一个基于特征融合和机器学习的恶意网页识别方法,将HTTP请求特征与传统网页特征相融合,再利用机器学习分类算法构建网页分类模型区分正常和恶意网页。从Alexa选取500个正常网页,从PhishTank和Malwaredomains中共选取500个网页作为恶意网页构建数据集,训练网页分类模型。通过实验验证了基于URL特征、网页代码特征和HTTP请求特征的方法优于不使用HTTP请求特征的方法,并且发现随机森林分类算法更适用于恶意网页识别。
来源:2019年第5期
《南京邮电大学学报(自然科学版)》期刊编辑部