Static / Reproducible
DATA ARCHIVE · 2010–2016Dataset v1.1

张一鸣微博语料
量化分析

基于上传的 355 页 PDF,对时间、发布来源、分享结构与文本形态做可复现描述统计。页面只使用可观测字段与透明规则,不从发帖数据推断人格、动机或价值判断。

01
DATA INTEGRITY

先判断“这份数据是什么”

封面数量、正文可识别记录、删除/不可见提示和重复正文分开处理;不补齐缺失微博。

CHECKLIST

完整性检查

02
ACTIVITY

发帖量如何随时间变化

按 PDF 中的时间戳直接统计,不对缺失区间做估计。

MONTHLY

月度时间线

空白月份显示为 0;后期稀疏首先是语料事实,不自动等同于发帖行为的完整变化。

CADENCE

记录节奏

年份记录数转发/分享率 · Wilson 95% CI未识别分享且非重复正文中位数移动端占比今日头条来源占比

2014–2016 的年度样本分别只有 38、47、1 条;页面保留数据,但不把这些年度比例当作稳健趋势。

03
CORPUS STRUCTURE

转发/分享与发布来源

“分享”只依据显式标记或来源字段识别;这不是对原创权的判断。

SHARE RATE

年度转发/分享率

规则:出现“转发微博”“//@”,或来源/正文明确标记为今日头条分享。

SOURCE MIX

来源结构迁移

来源来自 PDF 的“来自”字段,再归并为五组;不从内容反推设备。

TOP SOURCES

最常见发布来源

Top 10
04
TEMPORAL PATTERN

星期 × 小时分布

时区在源文件中未声明,因此这里只按文件显示的本地时间原样计算。

BY HOUR

按小时

BY WEEKDAY

按星期

05
TEXT SHAPE

文本长度与形式特征

该部分分母为“未识别为转发/分享、且正文不完全重复”的记录;不称为“原创微博”。

LENGTH

正文字符数分布

Aa
FORMAL FEATURES

可直接检测的形式特征

%

例如“含英文”只意味着正文出现连续英文字母,不代表英语表达能力或国际化倾向。

06
EXPLORATORY

无词典短语挖掘

这不是主题模型。只展示在非分享文本中统计上较“凝聚”的 2–4 字片段。

CHARACTER N-GRAM

高凝聚短语

探索性
为什么把这一块标成“探索性”?

中文没有天然空格分词。本报告不引入外部词典,使用字符 n-gram 的频率与最小切分凝聚度(PMI-like)排序,因此能发现重复搭配,但不能稳定地区分概念、实体和普通词。

07
DATA-BOUND FINDINGS

只陈述数据能支持的结论

不加入人物性格、成功原因或管理哲学等因果解释。

08
METHOD & LIMITS

方法与局限

为了让结果可复查,规则直接写在页面上,分析脚本也随项目提供。

DATA MANIFEST

数据版本与可复查指纹

Reproducible

SHA-256 用于确认分析所对应的源 PDF 是否完全一致;规则主题标签尚未完成人工金标准验证。

LIMITATIONS

限制条件

!