下载Lesuto Hub & Seller - 在 iOS 和 Android 上购物和销售
下载Lesuto Hub & Seller - 在 iOS 和 Android 上购物和销售
工作原理
选择一个购物者爬虫、Googlebot、Facebook、GPTBot 或审计爬虫。路径与生产环境匹配:边缘检测、api.lesuto.com/api/v2/prerender、24 小时缓存和源站回退。
实时追踪
Search and social crawlers on catalog paths. Included on Lesuto-hosted stores.
Googlebot on Cloudflare / Lesuto-hosted
In flight
Googlebot requests /products/teak-lounge
User-Agent: Googlebot/2.1
请求日志
01 info
Googlebot requests /products/teak-lounge
User-Agent: Googlebot/2.1
Lesuto托管的商店已经能够路由匹配的机器人。如果您使用自己的主机,请添加Cloudflare Worker或使用WordPress插件。在更改DNS设置之前,请使用curl进行确认。
问题
谷歌可以稍后渲染 JavaScript,但速度较慢。Facebook、LinkedIn、Slack、iMessage 和大多数 AI 爬虫只会抓取 HTML 源代码。如果该源代码是一个空的 JavaScript 代码库,则页面是不可见的。
它服务于哪些人群?
只有一个快照路径。不同的主机决定转发哪些用户代理。
Google、Bing、DuckDuckGo、Yandex 和百度获取的是渲染后的 HTML,而不是空的 HTML 代码。
Facebook、Instagram、LinkedIn、X 和 Pinterest 展开后可以显示标题、图片和价格。
Slack、iMessage、WhatsApp、Discord 和 Telegram 可以预览 URL 而不是空白链接。
WordPress插件会对常见的 AI 机器人进行快照。Cloudflare 则不会,除非你扩展了该 Worker。审计机器人永远不会预渲染。
包括
机器人检测、HTML、结构化数据、社交卡片、缓存和站点地图。访客绝不会被引导至此路径。
搜索爬虫和社交媒体推广工具通过用户代理进行识别。访问者仍然可以访问实时运行的 JavaScript 网站。
无头浏览器运行页面,然后返回包含源代码中已有内容的 HTML。Commerce Commerce SDK页面会等待就绪事件,以便目录 HTML 代码生成完毕。
Open Graph 和 Twitter 卡片,以便共享的 URL 在信息流和私信中显示正确的标题、图像和描述。
该WordPress插件还会对常见的 AI 爬虫(例如 GPTBot 和 ClaudeBot)进行快照。除非您更改 Worker,否则 Cloudflare 将一直保留在搜索和社交列表中。
首次抓取渲染成功。后续抓取将从缓存中获取。Lesuto 商店中Lesuto目录编辑会使快照失效。
标题、描述、Open Graph、Twitter 卡片和结构化数据都包含在爬虫抓取的 HTML 中,而不是稍后注入的。
在Lesuto产品目录页面上,当产品、系列或页面发生更改时,缓存会自动刷新。普通更新无需手动清除缓存。
Lesuto商店会获取包含产品和系列信息的 XML 站点地图,以便 Search Console 拥有完整的 URL 列表。
错误的站点密钥、未知的主机名或渲染器超时都会回退到源 HTML。爬虫程序不会看到空白的错误页面。
设置
连接域名,配置爬虫,并使用 curl 命令进行确认。Commerce Commerce SDK和WordPress是官方托管服务商。该域名上的任何 JavaScript 前端都可以使用相同的路径。
站点密钥将渲染引擎与您拥有的主机名绑定。访客仍然可以访问您的实时 JavaScript 应用程序。
在Lesuto托管的商店中,此功能已启用。在您自己的主机上,请添加 Cloudflare Worker、Apache 或 nginx 规则,或者连接WordPress插件。
使用 Facebook 或 Googlebot 用户代理执行 curl 命令应该返回 200 状态码并启用 X-Prerender 功能。然后,请检查 Google 富媒体搜索结果、Facebook 分享调试器和 LinkedIn 帖子检查器。
问题
上面的可视化图是 API、Cloudflare Worker 和WordPress插件使用的同一决策树。
No. Any JavaScript frontend has the same crawler problem. Connect a site key for your domain and route bots. Commerce SDK and WordPress are first-party hosts. SDK pages wait for a ready event so catalog HTML is complete. Other JavaScript on that domain snapshots after the render budget.
No. The Render Engine inspects the user-agent and only snapshots matching crawlers. Visitors keep the live JavaScript site, including cart and checkout when those are on the page.
Search engines (Google, Bing, DuckDuckGo, Yandex, Baidu) and social unfurlers (Facebook, LinkedIn, X, WhatsApp, Slack, Discord, Pinterest, Telegram). The WordPress plugin also routes common AI crawlers such as GPTBot and ClaudeBot. Cloudflare and Lesuto-hosted routing stay on the search plus social list unless you change that Worker on purpose.
SEO audit tools (Ahrefs, Semrush, Screaming Frog) are classified in the dashboard and are not prerendered, so they cannot spend render capacity. AI crawlers are classified everywhere. Only the WordPress plugin host hook prerenders a common AI set today.
The API returns 403 when the hostname is not on the site key, and 502 or 503 when a render fails. Your Worker or plugin then serves origin HTML so crawlers are not left with a blank error page.
Successful snapshots are cached for 24 hours. Catalog changes invalidate the cache. The first crawl for a URL runs a headless browser (12 second budget). Later crawls are served from cache.
携手共进,更美好
渲染引擎是您连接的任何 JavaScript 前端(包括 SDK、 WordPress和 Studio 页面)下的 HTML 快照层。