网站的来源统计最容易被一个词带偏:流量。
流量只说明有人来过。营销真正要回答的是另一组问题:人从哪里来,看了什么,提交了什么,销售是否跟进,最后有没有变成有效线索或订单。如果网站只在分析工具里留下一次访问,线索进 CRM 后却只剩姓名和电话,前面的广告、搜索和私域触点就断了。报表看起来很热闹,投放和销售仍然各说各话。
红数科技更看重的是“来源能不能跟着线索走”。这件事不用一开始就上很重的系统,但字段要在网站建设时想清楚。等询盘已经积累了一批,再回头补来源,通常补不回来。

先把“来源”拆开,不要只留一个 channel
一条线索至少有两个值得保留的来源。
第一个是首次来源,也就是这个浏览器第一次被网站识别时从哪里进入。它适合回答“哪个渠道带来了新线索”。第二个是本次或转化前来源,记录访客这次访问、尤其是提交表单前从哪里回来。它更接近“哪个触点促成了这次行动”。
两者不一定相同。有人第一次从百度自然搜索进入,隔了几天又点开销售发来的微信链接,最后提交需求。把这条线索全部算给搜索,私域承接的作用会消失;全部算给微信,最早带来认知的搜索又被抹掉。与其争论唯一正确的答案,不如把首次来源和转化前来源都保留下来,管理层看获客,运营看促成,口径反而更清楚。
网站端建议保留这些基础字段:
| 字段 | 记录什么 | 主要用途 |
|---|---|---|
first_source / first_medium | 首次来源与媒介 | 判断最初获客渠道 |
first_campaign / first_content / first_term | 首次活动、素材、关键词 | 比较广告和内容表现 |
last_source / last_medium | 本次或转化前来源 | 判断促成线索的触点 |
landing_page / referrer | 首次落地页与引荐网址 | 还原入口和外部引荐 |
click_id | 广告平台点击标识,如 GCLID | 广告回传和线下转化匹配 |
lead_id / session_id | 线索与访问的内部标识 | 把网站行为接到 CRM |
conversion_page / conversion_time | 提交页面与时间 | 核对转化发生位置 |
这里的 session_id 和 lead_id 应由自己的系统生成。手机号、邮箱、姓名不要放进网址参数,更不要拿它们充当公开可见的追踪标识。
广告来源:UTM 负责解释,点击标识负责核对
广告链接至少要带一套统一的 UTM 参数。常用字段并不复杂:utm_source 表示平台或来源,utm_medium 表示媒介,utm_campaign 表示活动,utm_content 区分素材或广告位,utm_term 可记录付费搜索关键词。Google Analytics 的配置文档也沿用这组广告系列字段:campaign_source 对应来源,campaign_medium 对应媒介,campaign_name 对应活动,并可覆盖相应的 UTM 查询参数。
难点不是会不会加参数,而是团队能不能始终用同一套命名。今天有人写 wechat,明天有人写 weixin,下周又多出 WX,报表里就会变成三个渠道。utm_medium 也不要一会儿写 paid,一会儿写 cpc。先做一张命名表,明确英文小写、单词分隔方式和每个字段由谁填写,比后期反复清洗数据省事。
一条百度搜索广告链接可以写成:
UTM 告诉人“这是什么投放”,平台自动生成的点击标识则方便系统核对具体点击。以 Google Ads 为例,官方文档把 GCLID 定义为用户点击广告进入网站时从网址参数中捕获的标识符,并建议在线下转化导入时尽可能一并提交。所以落地页不能只读取 UTM,还应把能够合法获得的平台点击标识一并保存,并在表单提交时写入线索记录。

有一个常见失误:访客进入落地页后,网站跳转了一次,参数没了;或者用户浏览了几页再填表,表单只读取当前网址,自然什么也读不到。稳妥的做法是,第一次落地时就把来源写入第一方存储,并同步到服务端会话;表单提交时从已保存的来源字段取值,而不是临时看地址栏。
浏览器 Cookie 或本地存储会被清除,也可能受到隐私设置影响,因此它们不是永久身份证。只要访客已经提交表单,来源就应随 lead_id 写入业务数据库或 CRM。前端负责先接住,服务端完成留档。
自然搜索:能识别搜索引擎,不代表总能拿到搜索词
自然搜索进站时,网站通常可以从引荐网址识别搜索引擎,再把媒介归为 organic。但“来自搜索”与“搜索了哪个词”是两件事。搜索引擎、浏览器和隐私机制可能不把完整查询词传给网站,仅靠 referrer 很难还原每一次访问的关键词。
更合理的做法,是把站内分析工具和站长平台放在一起看。Google 搜索中心在 2026 年更新的说明中把两者分得很清楚:Search Console 记录展示、点击和查询等进站前数据,Google Analytics 记录访客进入网站后的页面与行为;由于指标和系统不同,两边的数据不会完全一致。百度自然搜索也应采用同样的思路:站长平台看搜索曝光、点击和词,网站统计看落地页、访问和转化,不强行把每个查询词与每条线索一一对应。
这并不影响判断内容价值。把搜索查询、落地页和线索主题放在同一张分析表里,已经能看出哪些页面持续获得搜索点击,哪些页面带来的访问会继续阅读或提交需求。能做到页面级、时间段级的可靠比较,比给每条线索硬塞一个并不确定的关键词更有用。

私域来源:不要都写成“微信”
私域最容易丢数据,因为链接会经过聊天窗口、二维码、短链、小程序或人工转发。最后报表里只剩 direct,并不代表访客真的在浏览器里手输网址,更多时候是引荐信息在中途没有传过来。
解决办法是给每个可管理的入口分配来源码。比如公众号菜单、企业微信欢迎语、销售资料 PDF、线下展会海报和老客户转发二维码,即使都在微信里打开,也不应该使用同一个链接。可以把字段定成:
-
utm_source=wechat:来自哪个大平台; -
utm_medium=private或 qr:通过什么媒介进入; -
utm_campaign=2026_autumn_launch:属于哪次活动; -
utm_content=oa_menu_service:具体入口或素材; -
asset_id=qr_017:内部可查的二维码或物料编号。
二维码最好先指向企业自己的短地址或跳转地址,由服务端记下来源码,再用 302 跳到最终落地页。这样以后更换页面,不必重印所有物料;某些应用内浏览器丢失引荐信息时,也还有来源码可用。个人销售可以分配内部编号,但不建议把姓名、手机号直接写在公开链接里。
如果一条链接可能被多次转发,系统能确定的是“原始物料或原始入口”,不一定能确定最后是谁转给了谁。文章、报表和考核都要守住这个边界。追踪技术能减少盲区,不能凭空恢复没有采集的数据。

表单、电话和在线沟通,都要落到同一条线索上
来源记录最终要进入业务系统。表单是最容易接通的一种:页面加载时把首次来源和本次来源放入隐藏字段,提交后连同 lead_id 一起写入 CRM。销售后续补充有效性、需求类型、报价、成交和成交金额,原始来源字段只读,不要让人工随手覆盖。
电话需要使用能够区分渠道的号码或呼叫追踪方案;如果所有页面都展示同一个固定电话,又没有询问和登记机制,系统无法判断来电来源。在线客服、企业微信添加和第三方预约工具也一样,要么把来源参数带到对方系统,要么在本方服务端先生成线索编号,再完成跳转。
跨域尤其要提前测试。网站、商城、预约系统和支付页面如果分属不同域名,访客从一个域跳到另一个域,可能被识别成新访问;支付服务商还可能被误记为最后来源。常见处理包括跨域关联、保留第一方标识、排除不应计入来源的支付引荐,以及在服务端用订单号或线索号重新关联。具体选哪一种,取决于使用的统计工具和业务系统,不能只靠页面上多装一段代码。
报表不要只出一份“渠道排行榜”
来源数据接通后,至少应保留两种观察口径。
首次来源适合评估获客:哪个广告平台、搜索页面或私域入口带来了新线索。转化前来源适合评估承接:访客在提交前最后一次从哪里回来。预算较高、决策周期较长的业务,还可以保留触点时间线,但不要急着用一个复杂公式给每个触点分成。数据量不够、身份关联不稳时,精密的小数只会让估算看起来像事实。
该放在一起比较的,是渠道费用、访问、有效线索、商机和成交,而不是访问量单项。一个渠道访问少,但有效线索率高,未必应该停;另一个渠道点击便宜,销售却持续判定为无效,也不能只凭前端转化率扩量。
上线前可以拿下面几条路径逐一测试:广告链接经过跳转后参数还在不在;微信内打开二维码能否识别场景;浏览多页后提交表单是否仍带首次来源;跨域预约是否被重置;同一访客再次回来时首次来源是否保持、本次来源是否更新;CRM 是否收到对应字段;重复线索合并后原始来源是否还在。每次改版、换表单或接入新的客服工具,都要重新走一遍。
归因能做多细,最后还要看隐私边界
来源参数、Cookie 标识、广告点击标识、表单信息和 CRM 记录一旦组合起来,就可能与具体个人建立联系。中国《个人信息保护法》要求个人信息处理遵循合法、正当、必要和诚信原则,处理目的应当明确、合理,并限于实现目的的最小范围;以同意为依据时,同意应在充分知情的前提下自愿、明确作出;处理前还应清晰告知处理者、目的、方式、信息种类、保存期限和权利行使方式。
所以,网站不该为了“数据更全”无限收集。隐私说明要写清使用了哪些统计或广告工具、收集什么、为何收集、保存多久、是否交由第三方处理;需要同意的场景,应在相应追踪启动前取得有效同意并提供撤回方式。数据库按角色控制权限,导出留痕,保存期限到期后删除或匿名化。网址里不放个人信息,因为网址可能进入浏览历史、服务器日志、截图和转发记录。
把这些基础工作做好,来源报表依然不会达到百分之百准确。用户会清理 Cookie,会换设备,会从手机看到内容后在电脑上搜索品牌,也会把链接转给别人。成熟的做法不是许诺“绝对精准归因”,而是让可采集的数据有统一口径、有原始记录、能追到线索,并把无法确认的部分明确标成未知。
营销型网站的价值也就在这里:它不只展示业务,还能在访客愿意留下需求时,把这段来源线索完整地交给后面的运营和销售。广告、搜索和私域不再各自报一套漂亮数字,企业终于可以围绕同一条线索讨论投入和结果。
参考资料
[^1]: Google for Developers,《Google Analytics 配置字段》,页面标注最后更新时间:2024-04-22,检索日期:2026-07-21。 [^2]: Google for Developers,《Google Ads API:管理线下转化》,页面标注最后更新时间:2026-07-06,检索日期:2026-07-21。 [^3]: Google 搜索中心,《使用 Search Console 和 Google Analytics 数据进行搜索引擎优化》,页面标注最后更新时间:2026-01-09,检索日期:2026-07-21。 [^4]: 中央网络安全和信息化委员会办公室,《中华人民共和国个人信息保护法》,2021-08-20 发布,检索日期:2026-07-21。