技术 SEO

Google 图片不收录:懒加载、img src、robots、CDN 与图片 Sitemap 排查

Google 图片不收录:懒加载、img src、robots、CDN 与图片 Sitemap 排查

直接答案 / DIRECT ANSWER

Google 图片不收录:懒加载、img src、robots、CDN 与图片 Sitemap 排查

先区分未发现、抓取失败和未选择展示

建立三段证据:渲染 HTML 是否包含图片 URL;服务器/CDN 是否收到 Googlebot-Image 请求并返回有效图片;搜索中是否最终展示。前两段失败是技术问题,前两段都通过仍不展示可能是质量、重复、选择或处理时间。

Google 不保证所有可抓取图片都进入或显示在图片搜索。报告应使用“已满足技术要求”而不是承诺排名或收录日期。

固定一个可复现样本

选一张原创、公开、长期稳定、位于可索引落地页的图片。记录落地页 URL、最终图片 URL、HTML 片段、HTTP 响应、发布时间、图片哈希和 Search Console 检查时间。

不要同时用站点 Logo、占位图、CSS 背景图和用户登录后图片测试,它们的发现与选择条件不同。

使用标准 img 元素

Google 官方图片 SEO 指南说明,Google 能发现 <img 元素 src 属性中的图片,也能处理位于 <picture 中的 img;CSS background images 不会被 Google 图片索引。

重要内容图应使用语义化 HTML:

不要只在 style="background-image:..." 中提供唯一版本。

srcset 仍要提供 src 回退

响应式图片可使用 srcset 和 <picture,但 Google 建议始终在 <img 上提供有效 src 回退。若 src 是透明占位图,真实图片只存在于自定义 data-srcset,发现可能依赖 JavaScript。

检查渲染后的 HTML,而不只是模板源码。确保最终 src 是可访问的真实图片 URL。

懒加载不能依赖用户滚动或点击

Google 的懒加载指南强调,Google Search 不会像用户一样滚动或点击来触发内容。相关图片应在进入 viewport 时自动加载,可使用浏览器原生 loading="lazy"、IntersectionObserver 或支持可见性加载的库。

首屏主图不要过度懒加载。既影响用户体验,也可能让关键内容发现与渲染推迟。

用 URL Inspection 查看渲染结果

在 Search Console URL Inspection 的实时测试或已抓取页面中查看渲染 HTML,搜索目标图片 URL。若 URL 没进入 <img src,先修复渲染,不要反复提交 Sitemap。

截图只是辅助证据。图片出现在截图但 URL 不在可解析 HTML,不能证明抓取器能稳定发现资源。

JavaScript 错误会中断图片注入

Hydration 失败、接口 401、动态 import 错误、Consent 脚本阻断或 Service Worker 缓存旧 bundle,都可能让浏览器偶尔显示而 Google 渲染失败。

检查渲染时控制台、网络请求和最终 DOM。提供 SSR/静态 HTML 回退比依赖复杂客户端状态更稳健。

图片 URL 必须返回真实图片

直接请求图片 URL,检查状态码、Content-Type、Content-Length、魔数和解码结果。HTTP 200 返回 HTML 错误页、登录页面或防盗链提示,不是有效图片响应。

扩展名应尽量与格式一致。Google 支持 BMP、GIF、JPEG、PNG、WebP、SVG 和 AVIF 等格式,但 CDN 转码后仍应给出正确类型。

避免 Cookie 或登录依赖

Googlebot-Image 不会携带普通用户的登录 Cookie。需要会话、签名 URL、一次性 Token 或浏览器本地存储才能访问的图片,不适合作为公开搜索图片。

公共图片应有稳定、无需认证的 HTTPS URL。私有用户内容则不应为了收录而开放。

CDN 防盗链可能误伤 Googlebot-Image

基于 Referer 为空、User-Agent、地区或请求频率的防盗链规则可能返回 403、占位图或 302。Google 图片抓取与用户从落地页访问的请求头不一定相同。

用服务器日志确认真实拒绝原因,并按 Google 官方验证方法识别爬虫。不要只凭 User-Agent 建立无限白名单。

robots.txt 要分别检查页面与图片主机

落地页可抓取,不代表图片 CDN 域名也允许抓取。分别获取页面主机和图片主机的 /robots.txt,检查是否阻止图片路径或 Googlebot-Image。

图片若来自第三方 CDN,需要有权限管理其 robots 与访问策略。无法控制的临时图床会降低长期可靠性。

noindex 与图片发现不是同一个控制

页面 noindex、登录墙或 robots 阻止会影响 Google 访问页面及其图片上下文。图片自身是否进入搜索还受图片 URL 抓取与落地页信号影响。

不要用 robots.txt 阻止页面后期待 noindex 被读取;也不要只取消页面 noindex,却忽略图片主机的阻止规则。

HTTP 状态与重定向链要稳定

图片 URL 若经历多跳 301/302、循环、地区跳转或短期签名刷新,Google 可能抓取失败或把不同 URL 视为重复。目标应快速返回 200 和正确图片。

迁移图片 CDN 时使用单跳永久重定向,并保持旧 URL 足够时间。不要每天生成新查询参数 URL。

统一同一图片的引用 URL

Google 建议在站点中一致引用同一图片 URL,以便缓存和复用。随机尺寸参数、每页不同签名或无意义 cache-buster 会制造大量重复地址。

响应式尺寸可以存在,但应有稳定主版本与清晰 canonical 资源策略。清理参数前先确认 CDN 缓存和页面兼容。

图片 Sitemap 用于补充发现

Google 图片 Sitemap 可告诉 Google 通过 JavaScript 等方式不易发现的图片。可以建立独立图片 Sitemap,也可在普通 Sitemap 的 URL 条目中加入 image 扩展。

Sitemap 是发现提示,不会绕过 robots、认证、坏响应或低质量页面。只提交真实、可访问、与页面相关的图片。

跨域图片可以写入图片 Sitemap

Google 允许 <image:loc 引用其他域名,例如 CDN。官方建议在 Search Console 验证 CDN 域名所有权,以便获得相关抓取错误信息。

确认 CDN 域名长期归属、HTTPS 证书和 robots 策略。不要把无控制权第三方临时 URL 纳入批量 Sitemap。

Sitemap 必须使用最终绝对 URL

图片与落地页应使用完整绝对 HTTPS URL,避免相对路径、HTML 转义错误或过期查询参数。生成后对 XML 解析、命名空间和随机样本做 HTTP 验证。

Sitemap 更新时间应反映真实资源变化,不要每次构建都给所有图片伪造新时间。

图片落地页必须可索引且有上下文

图片放在薄内容页、搜索结果页、登录页或大量重复图库页,即使文件可抓取,也缺少清晰主题。将重要图片放在相关正文附近,给出解释、标题或 caption。

页面 title、正文和图片语义要一致。不要创建数千个只有一张图和关键词堆砌的空页。

alt 文本用于描述图片

Google 使用 alt、周边文本和视觉信息理解图片。alt 应准确描述图中内容和在页面中的作用,不是塞入同义关键词列表。

装饰图可使用空 alt 以符合可访问性语义;核心内容图提供简洁、具体的描述。不同语言页面应使用相应语言 alt。

文件名是轻量线索

Google 建议使用简短、描述性的文件名,避免 IMG0001.jpg 等无意义名称。文件名只是弱信号,不能替代正文和 alt。

重命名已上线图片会改变 URL,应配置重定向并更新页面、Sitemap、结构化数据和缓存。

高质量与速度需要平衡

清晰、高分辨率图片更适合搜索预览,但超大原图会拖慢页面。提供响应式尺寸、现代格式和合理压缩,同时保留足够清晰度。

不要用极小缩略图作为唯一 src,再要求用户点击加载大图;Google 可能只发现低清版本。

Structured Data 不能替代 img

Article、Product 等结构化数据中的 image 属性可帮助搜索功能理解首选图片,但技术上有效不保证展示,也不能弥补图片文件不可抓取。

确保结构化数据 image URL 与页面实际图片一致、可访问,并符合对应富媒体结果指南。

og:image 只是补充信号

og:image 可表达页面首选预览图,但 Google 图片发现的基础仍是可抓取图像与落地页。不要只写 meta 标签而把正文图片做成 CSS 背景。

用绝对 URL,并保持社交预览、结构化数据与实际主图一致,减少多个候选互相冲突。

SafeSearch 与内容分类会影响可见性

成人或敏感图片可能在启用 SafeSearch 时被过滤或模糊。若站点混合大量敏感内容,Google 对整站理解也可能影响普通图片展示。

按 Google 指南清晰隔离和标记相关页面。不能通过隐藏或误导元数据绕过安全分类。

检查 Googlebot-Image 日志

按已验证的爬虫来源统计请求状态、字节数、延迟、最终 URL 和 Content-Type。重点找 403、429、5xx、超时、0 字节和 HTML 响应。

不要把普通伪造 UA 计入 Google 流量。日志中不保存 URL Token、Cookie 或用户查询敏感信息。

WAF 与速率限制要分层

图片 CDN 可能对突发抓取返回 429,源站却完全正常。查看边缘与源站日志,确认限流发生位置和缓存命中率。

调整规则时只放宽所需静态路径,并保留 DDoS 防护。不要整体关闭 WAF。

变更后需要等待重新抓取和处理

技术修复不会立即反映到图片搜索。记录修复时间、TTL、重新抓取日志和 Search Console 状态,给 Google 重新处理的时间。

不要每天改 URL 或重复提交,让观察窗口不断重置。以抓取证据为进度指标,而不是手工搜索一次的排名。

建立自动化图片门禁

CI/巡检应检查核心页面渲染后存在 <img src、图片返回 200 与 image/、文件可解码、robots 允许、URL 稳定、alt 存在且不过度重复、图片 Sitemap XML 合法。

抽样覆盖不同模板、格式、CDN 域和懒加载位置,不能只测首页 Logo。

修复后的验收标准

验收应证明:落地页可索引;渲染 HTML 中有真实 img src;懒加载无需交互;页面与图片 robots 允许;图片 URL 无认证、返回 200 和正确字节;CDN 不拦截 Googlebot-Image;Sitemap 使用最终 URL;alt 与周边内容相关;日志已出现成功抓取。

是否最终展示由 Google 自动系统决定,不能把技术验收写成收录保证。

常见问题

网页已收录,为什么图片仍未收录?

页面索引与图片发现/抓取是不同链路。继续检查渲染 img src、图片主机 robots、HTTP 响应和 Googlebot-Image 日志。

CSS background-image 能进入 Google 图片吗?

Google 官方说明不会索引 CSS 图片。重要内容图应使用标准 `<img src>`,可位于 `<picture>` 中。

图片 Sitemap 能强制收录吗?

不能。它帮助发现图片,但不会绕过访问限制、错误响应、重复或质量选择。

懒加载必须全部关闭吗?

不需要。应确保图片进入 viewport 时自动加载,不依赖滚动或点击,并在渲染 HTML 的 img src 中出现真实 URL。

CDN 图片可以放进 Sitemap 吗?

可以。Google 允许跨域 image:loc,并建议验证 CDN 域名所有权以获得抓取错误信息。

参考资料

  1. 参考来源 1原始来源 · 正文事实与技术边界
  2. 参考来源 2原始来源 · 正文事实与技术边界
  3. 参考来源 3原始来源 · 正文事实与技术边界
  4. 参考来源 4原始来源 · 正文事实与技术边界