Apache/Nginx/PHP服务器反爬虫代码大全

来源：James 时间：2021-07-01 09:22:50阅读：0

ICT服务商

开启合作

企业SDWAN接入专线组网方案海外机房托管 SaaS应用加速

今天小编为大家汇总了Apache/Nginx/PHP服务器反爬虫代码大全，希望对你做网站优化有所帮助，如果想对爬虫技术深入了解的，请看《帮你深入了解爬虫与反爬虫技术》。

爬虫技术 一、Apache

①、通过修改 .htaccess 文件

修改网站目录下的.htaccess，添加如下代码即可(2 种代码任选)：

可用代码 (1)：

RewriteEngineOn
RewriteCond%{HTTP_USER_AGENT}(^$|FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedParser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|Python–urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)[NC]
RewriteRule^(.*)$–[F]

可用代码 (2)：

SetEnvIfNoCase^User–Agent$.*(FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedParser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|Python–urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)BADBOT
OrderAllow,Deny
Allowfromall
Denyfromenv=BADBOT

②、通过修改 httpd.conf 配置文件

找到如下类似位置，根据以下代码新增 / 修改，然后重启 Apache 即可：

Shell

DocumentRoot/home/wwwroot/xxx
<Directory“/home/wwwroot/xxx”>
SetEnvIfNoCaseUser–Agent“.*(FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedParser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|Python-urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms)”BADBOT
Orderallow,deny
Allowfromall
denyfromenv=BADBOT
</Directory>

二、Nginx 代码

进入到 nginx 安装目录下的 conf 目录，将如下代码保存为 agent_deny.conf

#禁止Scrapy等工具的抓取
if($http_user_agent~*(Scrapy|Curl|HttpClient)){
return403;
}
#禁止指定UA及UA为空的访问
if($http_user_agent~*“FeedDemon|IndyLibrary|AlexaToolbar|AskTbFXTV|AhrefsBot|CrawlDaddy|CoolpadWebkit|Java|Feedly|UniversalFeedParser|ApacheBench|MicrosoftURLControl|Swiftbot|ZmEu|oBot|jaunty|Python-urllib|lightDeckReportsBot|YYSpider|DigExt|HttpClient|MJ12bot|heritrix|EasouSpider|Ezooms|^$”){
return403;
}
#禁止非GET|HEAD|POST方式的抓取
if($request_method!~^(GET|HEAD|POST)$){
return403;
}

然后，在网站相关配置中的 location / { 之后插入如下代码：

Shell

如下的配置：

Shell

保存后，执行如下命令，平滑重启 nginx 即可：

Shell

三、PHP 代码

将如下方法放到贴到网站入口文件 index.php 中的第一个

PHP

//获取UA信息
$ua=$_SERVER[‘HTTP_USER_AGENT’];
//将恶意USER_AGENT存入数组
$now_ua=array(‘FeedDemon‘,‘BOT/0.1(BOTforJCE)’,‘CrawlDaddy‘,‘Java’,‘Feedly’,‘UniversalFeedParser’,‘ApacheBench’,‘Swiftbot’,‘ZmEu’,‘IndyLibrary’,‘oBot’,‘jaunty’,‘YandexBot’,‘AhrefsBot’,‘MJ12bot’,‘WinHttp’,‘EasouSpider’,‘HttpClient’,‘MicrosoftURLControl’,‘YYSpider’,‘jaunty’,‘Python-urllib’,‘lightDeckReportsBot’);
//禁止空USER_AGENT，dedecms等主流采集程序都是空USER_AGENT，部分sql注入工具也是空USER_AGENT
if(!$ua){
header(“Content-type:text/html;charset=utf-8”);
die(‘请勿采集本站，因为采集的站长木有小JJ！’);
}else{
foreach($now_uaas$value)
//判断是否是数组中存在的UA
if(eregi($value,$ua)){
header(“Content-type:text/html;charset=utf-8”);
die(‘请勿采集本站，因为采集的站长木有小JJ！’);
}
}