Skip to main content

第七篇:信息采集与数据分析——从哪找、怎么算、如何判断

本篇解决的问题:前面六篇教了你分析框架——但分析的前提是有数据。数据从哪来?怎么判断数据靠不靠谱?拿到数据后第一步干什么?

本篇核心:信源地图 + 信源评估方法 + 交叉验证 + 趋势分析 + 异常值识别 + 从数据到结论的判断原则。


一、信源地图:每种信息从哪来

研究一个行业时,你需要的不是"百度一下",而是一张信源地图——知道不同类型的信息去哪找。

第一层:宏观数据(行业和市场大盘)

你想要什么去哪找免费/付费可信度
行业市场规模、增速咨询公司报告(艾瑞、易观、 Frost & Sullivan 等)、券商行业研报摘要免费,完整版付费中(咨询公司的方法论靠谱,但具体数字常有水分)
政府统计数据国家统计局(stats.gov.cn)、各省市统计局、统计年鉴免费中高(有水分,但趋势可靠)
上市公司行业数据招股书("行业概况"章节)、年报("管理层讨论与分析"章节)免费(巨潮资讯网、SEC EDGAR)高(有法律责任,数字必须合理)
全球市场数据Statista、World Bank、IMF、UN Comtrade(贸易数据)部分免费中高
电商/消费趋势魔镜数据、蝉妈妈、阿里研究院、京东大数据部分免费中(样本偏差)

第二层:公司层面数据

你想要什么去哪找免费/付费
上市公司财务数据巨潮资讯网(cninfo.com.cn)、同花顺、东方财富、SEC EDGAR免费
非上市公司信息天眼查、企查查(工商信息、股东、诉讼)基础免费,深度付费
公司负面/法律信息中国裁判文书网、行政处罚公示系统、信用中国免费
融资/估值信息IT 桔子、企查查、Crunchbase、PitchBook部分免费
招聘信息(反推业务方向)Boss 直聘、猎聘、LinkedIn免费
产品/价格/评价淘宝、京东、美团、大众点评、App Store免费

第三层:无法从数据库获得的信息(暗信息)

你想要什么怎么获取
行业真实生态(谁和谁在暗斗)行业展会(站旁边听聊天)、行业群(潜水看戏)、跟行业里的人吃饭喝茶
公司真实经营状况(不是 PR 稿)离职员工的社交媒体、供应商和客户的间接评价、招聘岗位的突然变化
产品真实口碑(不是刷的评价)差评(最有信息量)、用户投诉的处理方式、复购率(如果能算出来)
地方经济真实现状实地去看——厂房在不在生产、店铺在不在营业、路上有没有人

招聘信息是免费的研究金矿。一家公司突然大量招某个方向的岗位 → 新业务在加速。一家公司大量招销售 → 产品 PMF 过了要冲规模。一家公司冻结了研发招聘但还在招运维 → 在收缩,只维持现有业务。

第四层:上市公司文件中的金矿

上市公司的招股书和年报是你最好的免费研究资料。以下是年报中信息密度最高的章节:

年报章节你能挖到什么
管理层讨论与分析管理层自己对行业的判断、竞争格局的描述、未来计划——这是花钱请咨询公司也未必能获得的内部视角
主营业务分析分产品/分地区的收入拆解、毛利率、前五大客户和供应商
行业概况(招股书)花了上百万请咨询公司写的行业分析,免费给你看
风险提示虽然看起来是法律免责声明,但认真看——"依赖单一供应商"、"政策不确定性"——是真风险
关联交易公司和股东/高管之间的交易——利益输送的信号灯

二、信源评估:怎么判断数据靠不靠谱

不是所有数据都平等。对每一个数据源,问四个问题:

问题 1:谁发布的?他有什么动机?

信源可能的动机偏差方向
行业咨询报告(免费摘要版)给付费完整版引流夸大市场前景("千亿市场等你来")
公司 PR 稿宣传自己选择性披露有利信息
政府工作报告体现政绩可能美化增长数据
券商研报推票/维护客户关系偏向乐观("增持"多于"卖出")
学术论文发表样本可能有偏差、数据可能过时
行业协会维护行业利益夸大行业重要性和就业贡献

没有"完全客观"的数据源。 关键不是找没有偏差的来源,而是知道每个来源的偏差方向,然后通过交叉验证修正它。

问题 2:数据是怎么采集的?

  • 问卷调查 → 样本代表吗?回收率多少?(回收率 3% 的问卷毫无意义——愿意填的人本身就是偏差)
  • 专家访谈 → 访谈了几个?同一圈子的人观点可能高度一致
  • 爬虫/大数据 → 覆盖了哪些平台?有没有系统性缺失?

问题 3:数据是什么时候的?

超过两年的行业数据,对快速变化的行业(电商、AI、新能源)基本是历史文献。看报告先看发布日期。

问题 4:这个数字的量级合理吗?

  • "某行业市场规模 10000 亿"——中国 GDP 约 130 万亿,10000 亿 = 0.77%,一个细分赛道说"万亿"要打个问号
  • "某公司月活 5 亿"——中国网民约 11 亿,5 亿月活 = 中国近一半网民每月用?不太可能,除非是微信/抖音级别
  • 量级检查是最快的 BS detector。

三、交叉验证:最重要的一条原则

单一来源永远不可靠。

同一组数据,至少找三个独立来源。三个来源一致 → 大概率靠谱。两个一致一个不同 → 探究那个不同的为什么不一样。三个都不一样 → 你还没找到真相,继续找。

不一致的地方往往比一致的地方更有信息量。 如果两家咨询公司对同一个市场的估算差了一倍——不是谁错了,而是他们对"这个市场包含什么"的定义不一样。把定义搞清楚,你对这个行业的理解就上了一个台阶。


四、数据分析的四项基本功

拿到数据之后,你不需要会 Python 或 SQL。Excel 就够。但你需要四项基本功。

1. 分类与切分——"分而治之"

拿到一个模糊的大概念,第一步永远是切分它。

原则:选择有区分度的切分维度。如果你把汽车市场按"轿车/SUV/MPV"切——有意义,因为不同类型的利润率、消费者、竞争格局不同。如果你把汽车市场按"红色/蓝色/白色"切——没意义,因为颜色不影响商业逻辑。

好的分类维度:利润率不同的、客户群不同的、竞争格局不同的、增长阶段不同的。

2. 趋势分析——"看方向不看绝对值"

数据有水分的常见情况:统计局的数据、行业协会的数据、公司自报的数据——但趋势方向通常是诚实的

你不能确定 A 县 GDP 到底是 500 亿还是 400 亿,但你能看到它是在涨还是在跌。拐点在哪里。拐点前后发生了什么。拐点 + 事件 = 故事的起因。

3. 异常值识别——"最奇怪的那个数字就是故事"

看数据先说"有没有什么不对劲"。秦池 1996 年以 3.2 亿拿下标王,行业正常营销费率是 5-7%——这个数字本身就是警报。你不需要做任何复杂分析就能看到它不正常。

方法:算出行业均值 → 找到偏离均值 2 个标准差以上的数据点 → 每个异常值背后一定有一个故事。找到那个故事,你对这个行业的理解就深了一层。

4. 多维对比——"单看没意义,对比才有"

单独一个数字没有信息量。秦池投 3.2 亿广告——多了少了?你不知道。秦池投 3.2 亿而同行平均投 1000 万——你知道它是什么级别的赌徒了。

对比维度:同行业 vs 自己,历史同期 vs 现在,中国 vs 海外,同体量公司 vs 自己。至少拉三个对比维度。


五、从数据到结论:四条硬原则

分析做完,结论怎么写?四条原则保证你的结论不跑偏:

1. 交叉验证过才敢用——单一来源的结论打问号,至少三个独立来源互相印证

2. 看趋势不看绝对值——哪怕数据有水分,五到十年的趋势方向通常是真实的

3. 关注异常值——突然变好或变差的数据点,背后一定有原因。那个原因往往是分析的关键突破点

4. 实地补数据——二手资料永远替代不了一手观察。如果你对分析结论很自信但又没去现场看过——你至少应该打七折


六、一个真实的信息采集流程

假设你要研究中国咖啡行业。以下是一个实际的 3-4 天信息采集计划:

Day 1:建框架 + 找公开数据(3-4 小时)

  1. 百度/Google:"中国咖啡行业市场规模 2024"→ 找 3-5 份行业报告,记下它们对市场规模的不同估算
  2. 巨潮资讯网 → 搜"咖啡"→ 找到瑞幸、星巴克中国的相关公告和招股书
  3. 国家统计局 → 查咖啡进口量(海关数据)、城镇居民消费支出
  4. 开一个笔记 → 记下所有数字的"来源 + 时点 + 可信度评估"

Day 2:深入公司层面(3-4 小时)

  1. 下载瑞幸 2024 年年报 → 读"管理层讨论与分析" → 记录:门店数、同店增长、成本结构、自有 APP 订单占比
  2. 企查查 → 搜 Seesaw → 看股东变更、破产清算的司法记录
  3. Boss 直聘 → 搜"Manner"、"库迪" → 看近期招聘岗位(判断他们在扩张还是收缩)
  4. 大众点评/美团 → 找你所在城市的 5 家咖啡店 → 看评分、差评和客单价

Day 3:暗信息补充 + 画分析(2-3 小时)

  1. 小红书/微博 → 搜"咖啡价格战"、"瑞幸库迪" → 看真实消费者怎么说
  2. 如果你认识的有人在做餐饮/消费投资 → 约个 15 分钟电话,只问一个问题:"咖啡行业你最看不懂的是什么?"
  3. 把所有收集的信息填入前六篇的框架:产业链图 → 利润池 → 竞争格局 → 护城河判断

Day 4(可选):实地

去你所在城市最热闹的三家咖啡店(瑞幸/库迪/星巴克/Manner),各点一杯,坐半小时。观察:客流结构(外卖 vs 堂食)、客单价、排队时长。


七、常见错误

错误 1:百度一下就开始分析

❌ 搜"咖啡行业分析",打开第一篇公众号文章,看完就开始写分析

✅ 至少找到政府数据(统计局/海关)、公司数据(年报/招股书)、第三方数据(咨询报告/券商研报)三组来源。免费信息拼起来可能就够了,但至少要知道它们各自的偏差方向。

错误 2:数据收集没有尽头

❌ "我再多找几份报告"——一直找资料,永远不开始分析

✅ 给信息采集设置时限。3 天内如果还没找到关键数据,有两种可能:(1)这个数据确实不存在(那就要诚实地标"未知");(2)它在暗信息里,公开渠道拿不到(那就要换方法)。

错误 3:忽略反常识的信息

❌ 看到跟自己预想不一致的数据 → "这个数字不对吧" → 忽略它

✅ 跟你预想不一致的数据最值得关注。你预想瑞幸价格战会亏→但 Q2 扭亏赚了 8.7 亿→这个反常识的数据告诉你:你对瑞幸的成本结构理解有盲区。