GEO 抓取与引用说明
豆包、DeepSeek 能否收录灵妆官网?
技术上,公开网页可以被搜索或联网问答系统抓取和检索;但抓取成功、进入候选索引、被问题召回和最终显示引用是四件不同的事。灵妆不会宣传“保证收录”或“保证回答排名”。
抓取
爬虫请求网页并获得 200 响应,只能证明服务器成功返回内容。
索引
平台可能对内容质量、重复度、可信度、安全性和时效性进行过滤,抓取不自动等于进入索引。
召回
只有用户问题与页面主题匹配时,检索系统才可能把网页放入本次回答的候选材料。
引用
最终是否采用、如何表述、是否展示链接由平台决定,站点和第三方服务商都不能保证。
灵妆官网已经满足的可抓取条件
- 正文在服务器返回的 HTML 中完整存在,不依赖浏览器执行 JavaScript 才能看到核心事实。
- robots.txt 允许搜索和 AI 发现 UA 访问公开页面,同时禁止私有统计与事件接口。
- sitemap.xml 列出首页、功能、制作指南、兼容性、隐私安全与本说明页。
- llms.txt 和 llms-full.txt 提供短版与完整机器可读产品事实。
- SoftwareApplication、HowTo、FAQPage、WebPage 与 BreadcrumbList 结构化数据和可见正文一致。
- 未知配置与框架探测路径返回真实 404,不再伪装成正常内容页。
服务器日志如何判断访问
可靠的第一步是查看原始 Nginx access log,并同时检查 User-Agent、请求路径、来源和状态码。200 表示页面成功返回;403 表示访问被拦截;404 表示请求路径不存在;301 或 302 表示发生跳转。
灵妆会识别常见的 Bytespider、DoubaoBot、Doubao-User、DeepSeekBot、MoonshotBot 和 ZhipuAI-DataBot UA 字符串,但这些名称只作为日志线索。由于 UA 可以被任意伪造,在没有官方 IP 或反向 DNS 验证时,统计面板将其标为“UA 发现”,不写成“官方已收录”。
截至本页复核日期,没有找到 DeepSeek 官方公开的稳定爬虫 UA 或站点提交规范,因此不会把 DeepSeekBot 当成可验证的官方身份。豆包相关 UA 同样按“行业观察字符串”处理,不用它单独证明收录。
常见问题
AI 爬虫访问成功就代表已经被收录吗?
不代表。HTTP 200 只能证明该请求拿到了页面;平台还可能进行质量、重复度、可信度与安全过滤。
进入 AI 索引就一定会在回答里引用吗?
不一定。进入候选索引、被某次问题召回、最终生成答案并显示引用,是不同阶段。
能否付费保证被豆包或 DeepSeek 引用?
灵妆官网不承诺、也不接受这类保证。外部服务无法控制平台最终召回、排序和回答生成。
如何确认 AI 爬虫是否来过?
查看 Nginx 原始访问日志中的 User-Agent、路径与 HTTP 状态码;同时要注意 User-Agent 可以伪造,不能单独证明官方身份。