币圈界报道:

海量短视频元数据开放:技术突破与法律风险并行

一名匿名开发者以 datasocial 账号名义,在开源平台 Hugging Face 上发布了总计约 56 亿条公开 TikTok 视频的元数据,覆盖时间范围自 2014 年 7 月至 2026 年 10 月。该数据集以 460 GB 的体量存储于 Parquet 格式,按月划分,仅包含文本与结构化指标,不涉及原始视频文件。

核心字段解析:从标签到互动行为的全景映射

每条记录均包含视频标题、关联标签、音频标识符、屏幕文字内容、商品链接及卖家身份信息,并集成浏览量、点赞数、评论数、分享次数、收藏量与下载次数等多维度用户行为数据。部分字段直接来自 TikTok 内部标记系统,如是否被标注为‘AI生成’或是否已被移出推荐页(For You Page),早期视频因缺乏更新而多数为空值。

开放获取机制与传播现状

该数据集未设访问限制,可自由下载。截至统计,已在 Hugging Face 平台获得超过 1,180 次下载,同时可通过指定网页在线调用。其低门槛特性使其迅速成为研究者与开发者关注焦点。

驱动需求:为何此数据对AI训练至关重要?

当前官方渠道对 TikTok 数据的开放极为有限,主要面向欧美多国高校及欧盟非营利组织,需经历复杂申请流程。相比之下,该数据集提供了大规模、高颗粒度的内容特征,是构建预测内容传播趋势模型、分析 TikTok Shop 爆款商品规律以及训练语言模型理解短视频文案风格的关键输入。

技术实现路径:绕过防护机制的数据采集方法

据技术披露,datasocial 使用模拟安卓设备身份、逆向解析 API 请求签名并伪造 TLS 握手的方式,接入 TikTok 私有移动端接口。整个过程无需账户登录,三周内完成对 32.3 亿创作者资料、59.4 亿视频与 28 亿条评论的批量采集。

法律挑战浮现:大规模数据采集正面临司法审查

此类行为已触发法律纠纷。2025 年 10 月,Reddit 对 Perplexity 及三家数据公司提起诉讼,指控其实施“工业化规模”的内容提取用于 AI 训练。今年 7 月,联邦法院驳回被告要求终止案件的动议,案件中涉及的 DMCA 投诉显示,相关工具涉嫌规避 Google 搜索的反爬机制,为类似操作敲响警钟。

许可策略与商业化布局

免费版本采用 CC BY-NC 4.0 许可协议,明确限定仅限学术研究与个人使用。商业用途、完整创作者信息及实时更新服务均指向官网付费通道,而用于采集数据的源代码则单独标价 1,699 美元出售。尽管数据集中未显式列出用户名,但通过组合信息仍可追溯至具体账号,存在隐私泄露风险。

同类项目并存:数据生态加速形成

除本数据集外,另一套基于 TikTok 移动端接口采集的 45 亿视频数据也已上线 Hugging Face,同样提供非商业用途免费访问,但其采集工具包售价高达 1,699 美元,反映出数据资产化的趋势正在加速成型。