一份公开文件已经发布,站内搜索却搜不到;用完整标题能找到,换成群众常用的说法就没有结果;智能问答引用了旧版本,或者只抓到附件名称,没看见正文。这些问题常被归到“搜索不够智能”,实际往前追,很多时候是页面没有把信息交代清楚。

搜索系统读网页,先要拿到页面,再判断页面主题,抽取标题、正文、发布者、日期和链接关系,最后才谈得上索引、排序与引用。智能搜索虽然多了一层语义理解和答案生成,也绕不开这条路。Google 搜索中心在 2025 年 12 月更新的说明中明确提到,进入 AI 概览或 AI 模式不需要额外的特殊优化:页面仍要先被索引,符合摘要展示条件,重要内容应以文字形式提供,结构化数据还要和页面可见文字一致。

这件事对信息公开尤其重要。政策文件、通知公告、办事依据、统计数据和结果公示,往往同时带有发布机关、文号、成文日期、生效日期、有效状态等字段。人可以凭经验补全上下文,机器面对“关于做好有关工作的通知”这类标题,却很难判断“有关工作”究竟指什么。如果正文又只存在于扫描件里,页面只剩一句“附件见下”,搜索系统拿到的有效信息就更少了。

从红数科技的服务视角看,改善搜索理解,起点不是多铺关键词,而是把一条公开信息整理成边界清楚、来源明确、关系可追的网页对象。

搜索系统读取公开信息

先让正文真正出现在可读取的页面里

最容易被忽略的问题,是“浏览器里看得见”和“抓取后拿得到”并非总是一回事。

公开内容最好直接进入页面 HTML。PDF、Word 和图片可以保留,供下载、打印或核对原件,但不宜成为唯一的信息载体。扫描件至少要经过文字识别与人工校对,把标题、正文、表格说明和关键字段同步到网页;复杂表格还应提供可访问的 HTML 表格或结构化数据下载。否则,搜索系统可能只知道这里有一个文件,却不知道文件里具体说了什么。

页面本身也要稳定。有效内容返回 200 状态码;删除且没有替代内容的页面,应返回合适的 404410,不要让所有失效地址都跳回首页。重要正文如果完全依赖浏览器执行 JavaScript 后才出现,会增加抓取和渲染的不确定性。Google 的 JavaScript SEO 文档仍建议采用服务器端渲染或预渲染,因为这能让用户和抓取工具更快看到内容,而且并不是所有抓取程序都能执行 JavaScript。

还有几项基础检查很朴素,却经常决定后面的工作有没有意义:robots.txt、页面级 noindex、CDN 与安全防护策略不能误拦正常抓取;站点地图应提交规范地址和真实更新时间;栏目页、专题页和相关文件之间要有普通的 HTML 链接;同一内容存在打印版、移动版或多条访问地址时,应确定一个规范网址,并正确使用 rel="canonical"

站点地图能帮助发现页面,但它不是收录承诺。Google 的官方说明也写得很直接:站点地图可以帮助搜索引擎发现网址,不能保证其中所有内容都会被抓取和编入索引。把链接放进 XML,并不能补救空白正文、重复页面或错误状态码。

网页正文与附件协同

一页只讲清一件事,字段不要靠读者猜

搜索系统需要确定页面的主要对象。信息公开页面最常见的干扰,是一页塞进多份文件、标题过于笼统、页面标题与正文标题不一致,或者发布时间、成文日期、施行日期混在一起。

一个稳妥的详情页,至少要让人和机器都能回答这些问题:谁发布的,发布了什么,什么时候形成,什么时候公开,现在是否有效,原始依据在哪里,有没有后续修改或配套解读。具体字段随内容类型变化,不必机械凑齐,但字段含义必须固定。

页面信息应当说清的内容常见问题
标题文件、事项或数据的完整名称只写“通知”“公示”,离开栏目就失去语境
发布主体发文机关、责任单位或内容来源站点名称被误当成文件发布机关
标识信息索引号、文号、公告编号等页面有文号,附件里却是另一种写法
时间成文、发布日期、生效、失效及更新时间只显示系统录入时间,或更新后覆盖原日期
状态现行有效、已修改、已废止、已失效等旧文件仍能访问,却没有醒目的状态说明
分类主题、体裁、对象、地域和业务范围分类只存在于后台,前台无法看见和导航
关联内容原文、解读、附件、修订记录、上位依据解读与原文各自孤立,无法确认对应关系

国务院办公厅发布的《政府网站发展指引》早已提出,法规、规章和应主动公开的政府文件要提供准确的分类和搜索功能;文件修改、废止或失效时,应及时公开,并在原文件上明确标注。现行《中华人民共和国政府信息公开条例》也要求政府信息公开目录包含索引、名称、内容概述和生成日期等内容,公开平台应具备检索、查阅和下载功能。这些要求本来是为了方便公众使用,恰好也是机器准确识别信息的基础。

摘要不要写成“为进一步做好相关工作,现将有关事项通知如下”这种可以套在任何页面上的话。更有用的摘要,是用两三句话说明文件解决什么问题、适用于谁、关键时间或范围是什么。正文较长时,小标题应跟着真实内容划分;问答式解读要保留问题与答案的对应;涉及条件、例外和办理材料时,不要只做一张流程图,旁边要有可以检索的文字说明。

公开信息字段与关系

结构化数据是说明书,不是另一份内容

页面对人已经说清楚以后,再用结构化数据把同样的信息交给机器,效果才稳定。

Google 推荐在大多数场景使用 JSON-LD。文章类页面可以按实际内容采用 ArticleNewsArticleBlogPosting,并准确填写 headlineauthordatePublisheddateModifiedimage 等属性;面包屑、组织信息和数据集等内容,也应选择与页面真实类型相符的标记。信息公开文件是否采用某个 Schema.org 类型,要看内容本身和目标搜索引擎的支持情况,不能为了显得完整硬套一个不相干的类型。

这里有一条边界必须守住:结构化数据只能描述页面上真实可见的内容。页面写着 2024 年发布,JSON-LD 却把更新时间填成当天;正文没有作者,标记里临时补了一个“权威专家”;文件已经失效,结构化数据仍然把它当作最新政策,这些做法都会制造冲突。Google 的结构化数据指南明确要求,标记应描述所在页面的内容,不应加入用户看不到的信息。

结构化数据也不会自动带来靠前排名。它的作用,是减少机器理解页面时的歧义,并让符合条件的内容有机会获得相应的搜索展示。上线前应做语法与富媒体结果测试,上线后还要抽查渲染后的 HTML,因为模板升级、字段映射和前端改版都可能让原本正确的标记失效。

公开网页到智能引用链

智能搜索更看重“能不能核对”

传统搜索通常给出一组链接,智能搜索还要从多个来源中组织答案。它可能把一个问题拆成若干相关查询,寻找定义、条件、时间、例外和最新状态,再决定哪些页面适合作为支撑材料。Google 将这类过程称为“查询扇出”。这并不意味着需要另做一套所谓 AI 专用页面,反而说明公开内容之间的关系要更清楚。

例如,一份政策已经有新版本,旧页面不能简单删除,也不能静默覆盖。较好的处理是保留原文,明确标注状态和失效时间,链接到现行版本;新页面再说明替代了什么。政策解读应链接原文件,原文件也应回链解读。统计数据要写清统计口径、时间范围、责任单位和修订记录。这样,无论搜索系统命中哪一个入口,都有机会沿着关系找到当前有效、可核验的内容。

可信度也不是在页尾加一句“内容权威”就能获得。Google 对 E-E-A-T 的公开说明一直强调经验、专业性、权威性和可信度,但同时说明 E-E-A-T 本身不是某一个单独的排名因子。落到公开页面上,就是把作者或发布机关标清,把引用来源链接到原始材料,把事实与解释分开,保留修改痕迹,对适用条件和不确定之处如实说明。读者能查证,搜索系统才更容易判断这段内容是否适合引用。

上线后的验收,不能只搜一次完整标题

完整标题检索成功,只能证明最简单的一条路径通了。更接近真实使用的验收,应覆盖不同表达:用文号搜索,用“发布机关+事项”搜索,用群众常说的业务问题搜索,用旧称、简称和同义词搜索,也要故意输入已经废止的文件名称,看系统会不会把现行依据放在更合适的位置。

技术侧要查看抓取日志、索引状态、规范网址判断和渲染结果;内容侧要抽查字段完整率、来源一致性、状态标注和关联链接;站内搜索还应分别观察召回是否完整、排序是否合理、更新是否及时。智能问答则要核对答案中的机关名称、时间、文号、适用范围和引用链接是否与原页面一致。发现错误时,不要只改答案模板,先追到原始页面和数据关系,看看机器为什么会得到那个结论。

没有任何服务方能够保证某个页面一定被收录、稳定排在某个位置,或必然被智能搜索引用。能够被持续改进的,是页面是否允许抓取、内容是否完整可见、字段是否准确、版本是否清楚、关系是否可追溯。搜索系统理解公开信息,靠的不是某个神秘开关,而是一整套经得住人和机器共同核对的发布质量。

参考资料