COVERAGE
不插补封面口径 vs. 可解析口径
“可解析记录”指正文中能匹配 YYYY-M-D HH:MM 来自 … 的条目。差额不能自动解释为“丢失微博”。
封面数量、正文可识别记录、删除/不可见提示和重复正文分开处理;不补齐缺失微博。
“可解析记录”指正文中能匹配 YYYY-M-D HH:MM 来自 … 的条目。差额不能自动解释为“丢失微博”。
按 PDF 中的时间戳直接统计,不对缺失区间做估计。
空白月份显示为 0;后期稀疏首先是语料事实,不自动等同于发帖行为的完整变化。
| 年份 | 记录数 | 转发/分享率 · Wilson 95% CI | 未识别分享且非重复 | 正文中位数 | 移动端占比 | 今日头条来源占比 |
|---|
2014–2016 的年度样本分别只有 38、47、1 条;页面保留数据,但不把这些年度比例当作稳健趋势。
“分享”只依据显式标记或来源字段识别;这不是对原创权的判断。
规则:出现“转发微博”“//@”,或来源/正文明确标记为今日头条分享。
来源来自 PDF 的“来自”字段,再归并为五组;不从内容反推设备。
时区在源文件中未声明,因此这里只按文件显示的本地时间原样计算。
该部分分母为“未识别为转发/分享、且正文不完全重复”的记录;不称为“原创微博”。
例如“含英文”只意味着正文出现连续英文字母,不代表英语表达能力或国际化倾向。
这不是主题模型。只展示在非分享文本中统计上较“凝聚”的 2–4 字片段。
中文没有天然空格分词。本报告不引入外部词典,使用字符 n-gram 的频率与最小切分凝聚度(PMI-like)排序,因此能发现重复搭配,但不能稳定地区分概念、实体和普通词。
不加入人物性格、成功原因或管理哲学等因果解释。
为了让结果可复查,规则直接写在页面上,分析脚本也随项目提供。
SHA-256 用于确认分析所对应的源 PDF 是否完全一致;规则主题标签尚未完成人工金标准验证。