爬虫大全:Naver Yeti: Naver(韩国主流搜索引擎)的官方索引爬虫

编辑文章

简介

Naver YetiNaver Corporation用于发现并索引网页内容以服务于其搜索引擎(Naver Search)的官方网络爬虫。其最关键的独特属性在于:它是针对韩语内容和韩国互联网生态优化程度最高的爬虫之一,其用户代理字符串伪装成现代Chrome浏览器,但通过compatible; Yeti/1.1; +https://naver.me/spd明确声明了爬虫身份。Naver的搜索结果不仅影响韩国本土市场,也广泛应用于Naver Blog、Cafe等社区服务,其搜索入口面向全球韩语用户 。

用户代理

最具代表性的标准 User-Agent 字符串如下 :

Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Yeti/1.1; +https://naver.me/spd) Chrome/140.0.0.0 Safari/537.36

核心部分含义:
compatible; Yeti/1.1: 声明该爬虫身份及版本为Yeti 1.1。
+https://naver.me/spd: 提供网站管理员了解和使用该爬虫的官方文档链接。
Chrome/140.0.0.0: 爬虫会声明一个极高的Chrome版本号以测试网站对最新Web标准的兼容性 。

IP范围

该爬虫的源IP归属于Naver Corporation的AS域(AS23576),无固定单一CIDR,但具备明确的DNS命名模式,可通过反向解析验证 。

反向验证方法:
获取爬虫请求的源IP地址,执行反向DNS(PTR)查询。
Linux/macOS命令:

“`bash
dig -x [爬虫IP地址] +short
# 或
host [爬虫IP地址]
“`
– **Windows命令**:
“`powershell
Resolve-DnsName -Address [爬虫IP地址]
“`

验证成功标志:反向解析结果应匹配 crawl-<IP地址>.naver.<域名> 的模式,例如 crawl-61-247-222-83.naver.jp 。若解析失败或指向非naver.com/naver.jp域名,则该请求极有可能为伪造流量

交互策略

不屏蔽

  • 目标市场覆盖:如果你的网站业务目标是覆盖韩国用户,或网站包含高质量韩语内容,应当允许Yeti爬取。被Naver索引能为网站带来显著的韩国市场流量 。
  • 正常爬虫管理:它遵守标准的robots.txt协议,其爬取行为属于正常的搜索引擎索引,非恶意攻击 。

可屏蔽

  • 非目标市场:如果你的业务完全不针对韩语用户,且服务器资源有限,可以屏蔽Yeti以减少不必要的负载。
  • 私密或暂未准备好被索引的目录:对于网站的临时、测试或私密部分,应通过robots.txt限制其访问。

屏蔽代码示例:

robots.txt
User-Agent: Yeti
Disallow: /

# 或者更精细地控制
User-Agent: Yeti
Disallow: /private/
Disallow: /tmp/
Allow: /$

最佳实践

robots.txt

  • 命名需精准:在robots.txt中使用User-Agent: Yeti即可匹配,无需包含版本号。该爬虫严格遵守此文件指令 。
  • 谨慎完全屏蔽:在屏蔽前,请确认韩国市场的重要性。完全屏蔽Yeti将导致网站从Naver搜索结果中移除,对依赖韩国流量的站点影响巨大 。
  • 针对高频爬取优化:Yeti对高权威韩国域名的爬取频率可能非常高 。如果你的网站恰好是这种情况,建议在robots.txt中设置Crawl-delay指令(尽管不是所有爬虫都强制遵守,但这是一个标准做法):
    User-Agent: Yeti
    Crawl-delay: 1
    

SEO优化

  • 站长工具提交:利用 Naver Search Advisor 平台(https://searchadvisor.naver.com/)主动提交Sitemap。这能显著提升Yeti发现和索引网站新内容的效率。
  • 内容相关性优化:由于Yeti对韩语内容有特殊关注 ,如果你的网站旨在吸引韩国流量,确保核心关键词、元描述和正文包含高质量的韩语内容。
  • 结构化数据标记:像对待Google一样,使用标准的结构化数据(如JSON-LD)标记页面,有助于Yeti更好地理解页面内容类型,可能在Naver搜索结果中获得富媒体展现。

问题排查

  • 误判为恶意流量:运维人员看到Mozilla/5.0 ... Chrome/...的UA字符串时,容易误认为是普通用户或爬虫伪装。关键识别点是查找UA中的Yeti/字段和官方链接https://naver.me/spd。切勿仅凭Chrome前缀就放行或拦截 。
  • IP伪造:不要仅通过IP进行访问控制。攻击者可能伪造Yeti的UA字符串。唯一可靠的验证方法是进行反向DNS(PTR)查询,确认其解析域名归属于naver.*
  • 资源消耗误判:如果发现Yeti抓取频率过高导致服务器负载异常,先检查服务器日志确认其访问路径,然后通过robots.txt优化,而不是立即通过防火墙封禁IP段。直接封禁可能导致索引异常,且在IP段变动时维护成本高。