采回来的小红书数据一团乱?五步洗成能用的表
上一篇讲了不写代码怎么采集,很多人照着做了,然后卡在下一步:表格是有了,但「1.2万」和「12000」混在一列没法排序,发布时间一列写着「昨天」「3 天前」,同一篇笔记因为多次采集出现了三行。这样的表直接分析,结论一定是错的。先洗,再看。五步,Excel 或 WPS 就够。
第一步:去重
多次采集必然有重叠。用笔记链接(或「标题+账号名」)作为唯一标识,Excel 的「删除重复项」一键解决。注意保留采集时间最新的那一行。同一篇笔记,上周和这周的点赞数不一样,新的才是现状。
第二步:数字归一
「1.2万」「3456」「10w+」必须统一成纯数字,否则排序和求和全是错的。量不大就手改,量大用公式:查找「万」字,有则去掉后乘以 10000。处理完做个抽查:把这一列降序排一遍,看头尾有没有明显荒唐的值(比如一列里冒出一个 1.2,多半是「1.2万」漏乘了一万)。
第三步:日期归一
「昨天」「3 天前」「07-12」统一成标准日期(2026/07/12 这种格式)。相对时间要用采集那天倒推,所以采集时记下采集日期非常重要,这也是上一篇强调「每周固定时间采」的原因之一。日期归一之后,「近 30 天发文量」这类关键指标才算得出来。
第四步:打标签,补两列
原始数据只有平台给的字段,真正值钱的是你补的两列:题材(教程 / 测评 / 清单 / 经验分享……)和形式(图文 / 视频 / 合集)。这两列只能人工打标,50 篇也就二十分钟,打完你对这个赛道的理解会上一个台阶。标签体系别贪细,一层、五六个值封顶,否则每类只有两三篇,什么也比不出来。
第五步:算派生指标
最后加两列公式:互动效率(互动量 ÷ 账号粉丝数,粉丝量差很多的账号之间也能比)和发布至今天数(用来判断一篇的互动是不是还在涨)。这两列一出来,「哪类题材的普通账号也能拿到互动」这种问题,一个数据透视表就有答案。
五步走完,这张表就「能用」了。下一步怎么读?回到选题验证那篇的三个指标:供给量、互动中位数、头部集中度。现在你手里这张干净的表,每一个都算得出来。
