← 博客
JavaScript 网站:怎样检查爬虫能读到什么?
浏览器中显示完整的页面,最初收到的 HTML 可能几乎没有正文,文字随后才由 JavaScript 加载。这并不意味着所有搜索系统都看不到它。Google 可以执行 JavaScript 来处理页面,其他爬虫的处理能力则需要分别确认。
比较实际返回的内容
选一张服务页,列出必须能读到的信息:标题、服务内容、价格条件、覆盖地区和链接。再请开发人员检查这些内容是否已包含在服务器返回的 HTML 中。可以用下面的命令保存响应:
curl -L https://example.com/service/ -o page.html
查找正文信息本身,而不只是脚本文件名。同时检查 HTTP 状态和重定向。403 拒绝、429 限流或登录页面,与返回 200 但需要渲染的页面,是不同问题。修改 User-Agent 不能让测试请求变成经过验证的真实爬虫。
针对问题选择修改
静态生成和服务器端渲染,都可以让公开正文直接包含在初始 HTML 中。开发人员可以评估哪种方式适合有问题的页面模板。表单和计算器仍可使用 JavaScript,不一定需要重建全站。
修改后再次比较 HTML 与可见页面,检查站内链接、规范网址及内容是否一致。使用相关搜索引擎的检查工具,并在有条件时查看服务器日志。测试只能证明在当时条件下内容可读,不能证明 AI 一定会引用它。
参考资料
相关指南
相关指南
发布日期: · 由 geo-rank.ai 编辑团队审核 · 我们如何检查