Website public data scanner
网站公开数据扫描器
扫描 DTC 和 B2B 独立站网站的公开资料,快速了解该网站的搭建系统、统计工具、广告组件、业务类型、产品数量、Blog更新数量及频率、产品均价等核心信息。由于目标网站结构多样,且公开网络数据抓取存在限制,扫描结果仅供参考,不能保证 100% 准确。
参数清单
网站公开数据扫描项说明
这里解释本工具当前会展示的核心参数、计算口径和识别规则。所有结果都来自公开页面、公开链接、sitemap、页面源码和可抓取的结构化数据,不进入后台,也不代表网站质量评分。
建站技术栈
识别网站使用的 CMS、电商平台、Headless CMS 和公开可确认的前后端技术,例如 Shopify、WordPress、Storyblok、Next.js、Magento 等。
规则:优先匹配官方资源域名、系统专属路径、DOM 属性和前端全局变量。多层技术会组合显示;没有识别到标准 CMS 时,直接显示能够确认的技术栈,不会猜测为自研系统。
语言版本
统计网站公开可验证的语言版本数量,例如 en、de、fr;系统会自动确定本次扫描使用的语言版本。
规则:默认页面为英语时直接扫描;多语言网站存在可验证的英语版本时优先扫描英语分支;没有英语版本时使用网站默认语言。候选 URL 必须可打开且页面语言一致。
统计工具
识别网站是否安装 Google Analytics、Google Tag Manager、Microsoft Clarity 等公开统计工具。
规则:基于明确脚本地址、前端变量和跟踪 ID 判断。Google Search Console 的公开标签只代表网站所有权验证,不再作为正在运行的统计工具展示。
广告 / 转化
识别 Google Ads、Google Floodlight、Meta Pixel、TikTok Pixel、Meta 域名验证等广告或转化基础设施。
规则:只有检测到 fbq、connect.facebook.net、ttq、analytics.tiktok.com 等明确代码才显示对应 Pixel。Meta 域名验证和 Shopify Web Pixels 会单独标注,不能据此推断具体 Pixel 已安装。未发现也不等于没有投放,服务端 CAPI、GTM、用户同意后加载可能不公开暴露。
插件 / 组件
识别 Klaviyo、Yotpo、Judge.me、GoAffPro、Gorgias、Intercom、Zendesk 等第三方营销、评论、联盟或客服组件。
规则:只显示能够识别到具体品牌或技术服务商的组件。泛称 Live Chat 不作为插件名称展示,只会在联系方式中作为入口类型出现。
Affiliate
识别网站是否存在 Affiliate、Referral、Partner、Ambassador 等联盟或合作伙伴入口。
规则:只有检测到实际公开链接或联盟系统对外入口时才显示“发现入口”;正文中单独出现相关词语只作为线索,不算入口。
联系方式
识别页面公开出现的 Email、电话、WhatsApp、Live Chat、联系表单、Feedback 等联系路径。
规则:会抓取首页、部分产品页和 Contact 相关页面中的公开联系方式。这里展示的是联系方式类型,不展示完整隐私敏感内容。
业务类型
判断网站更接近 DTC、B2B、DTC + B2B 或其它。
规则:DTC 信号包括产品页、价格、购物车、checkout、支付入口;B2B 信号包括询盘、报价、批发、经销商、下载资料、项目/行业方案等。Affiliate / Referral 不参与 B2B 判断,避免误判。
公开 URL
统计本次从 sitemap、首页链接和公开导航中发现的 URL 数量。
规则:这是本次扫描发现量,不等同于真实页面总数或搜索引擎收录量。结果会记录已扫描 Sitemap 数量;触发扫描边界时会明确标记为部分覆盖。
产品页
估算网站公开产品页面数量。
规则:主要通过 URL 路径、sitemap 类型、结构化数据和电商平台常见路径识别,例如 /products/、/product/、商品 JSON-LD 等。
分类页
估算产品集合、类目、Collection 或 Catalog 类型页面数量。
规则:根据 /collections/、/category/、/catalog/ 等路径和 sitemap 结构判断。部分品牌会把专题页、系列页和分类页混用,因此该项是近似值。
抽样均价
从公开产品页抽样提取价格,并计算样本平均价格;这不是全站所有商品的真实平均价。
规则:Shopify 优先读取公开的 Best selling 排序,抽取前 10 个非礼品卡热门商品,并使用页面公开的商家基础市场和结算币种;无法取得热门排序时,回退到产品 Sitemap 分散抽样。3-7 个有效样本直接平均,8 个以上会去掉一个最高价和一个最低价。有效样本少于 3 个时显示“样本不足”;如果多数抽样页返回 401、403 或 429,则显示“受限访问”;如果至少 3 个已确认产品页均可访问但没有主价格字段,则显示“未发现公开价格”。
博客 / 新闻
估算博客、新闻、资源文章等内容型页面数量。
规则:通过 /blog/、/blogs/、/news/、/articles/、/resources/ 等路径和 sitemap 判断。它只统计公开内容资产,不判断内容质量。
最新内容
展示博客、新闻和资源文章合并样本中识别到的最新发布日期。
规则:优先读取文章详情页的可见发布日期、published meta、time、JSON-LD datePublished 和同站 RSS / Atom published。列表卡片日期必须经文章页验证,不能直接作为结果;只有未取得发布日期时,才使用 dateModified 或 sitemap lastmod,并将字段改为“最近更新”且明确标注来源。
更新周期
将博客、新闻和资源文章合并,估算网站近期整体内容更新节奏。
规则:只使用文章详情页或同站 RSS / Atom 明确公开的发布日期,至少需要 3 个不同日期,再按相邻间隔计算中位数;不使用 dateModified、列表卡片日期或 sitemap lastmod。历史停更或长断档会单独提示。
作者数
统计抽样内容中公开识别到的不同作者数量,用于了解公开内容维护人员规模。
规则:读取 author meta、Article JSON-LD 和明确作者字段,并合并大小写差异及常见职位后缀。很多品牌站隐藏作者,因此 0 只表示公开页面未识别到作者。
社媒入口
识别 LinkedIn、YouTube、Instagram、TikTok、Facebook、X、Pinterest 等公开社交媒体链接。
规则:主要来自首页、页脚、导航和公开链接。该项只判断是否有入口,不判断账号活跃度或粉丝规模。
证据
每个检测项尽量提供可点击的来源链接或源码信号,帮助确认结果从哪里来。
规则:证据只展示前几条代表性线索。由于部分脚本会动态加载,证据可能是 URL、脚本地址、页面字段或抽样页面。