导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

开发者免费发布56亿条TikTok视频元数据,Hugging Face成AI数据争夺新战场

导语:一名使用 hashfunction 账号的开发者通过 datasocial 账号,在开源AI存储库 Hugging Face 上发布了约56亿条公开 TikTok 视频的元数据。数据集可免费下载,覆盖2014年7月至2026年10月,但不包含视频画面。该数据集同时也在 datasocial.ai 提供。

该发布包含元数据,而非视频片段。每一行包括标题或字幕、话题标签、声音ID、屏幕文字、TikTok Shop 商品与卖家ID,以及观看、点赞、评论、分享、收藏和下载等计数。完整数据集为460 GB的 Parquet 文件,按每月一个文件组织。

Myriad: Which company will IPO next? Click to make your prediction.

部分字段是 TikTok 自身的标签,包括视频是否被标记为AI生成,以及是否被 TikTok 排除在“为你推荐”页面之外。对于来自档案的较旧视频,AI标志经常为空。该数据集未设置访问门槛,Hugging Face的计数器显示,截至撰写时已有1,181次下载。它也在 datasocial.ai 上提供。

AI开发者有强烈动机获取此类数据,而 TikTok 已使官方访问变得困难。数十亿条帖子的字幕、话题标签、声音ID和互动计数,可被用于训练预测病毒传播、TikTok Shop销售、可点击语言和短视频写作模式的模型。

TikTok Data Scraper Releases 5.6 Billion Video Metadata Records on Hugging Face for Free

TikTok 的官方路径更窄。其 Research Tools 向符合条件的学术机构研究人员开放,地区包括美国、欧洲经济区、英国、加拿大和瑞士,以及部分欧盟非营利机构,并需要申请和批准。广泛抓取不被允许。TikTok美国服务条款第3.4条禁止未经 TikTok 书面批准,使用自动化软件提取数据。

DataSocial 的说明称,其通过生成可冒充 Android 手机的设备身份、逆向工程请求签名和欺骗 TLS 握手,接触 TikTok 的私有移动 API。说明称,该系统在3周内收集了32.3亿个创作者资料、59.4亿个视频和28亿条评论。根据该说明,过程中没有涉及登录或账号。

TikTok Data Scraper Releases 5.6 Billion Video Metadata Records on Hugging Face for Free

免费层也充当店面。许可证为 CC BY-NC 4.0,数据集卡片称其免费用于研究和个人用途。商业用途、创作者资料和每日更新被导向 datasocial.ai,而抓取器源代码则单独出售。

抓取争端已经进入法庭。Reddit 于2025年10月起诉 Perplexity 和三家数据抓取公司,指控一项“工业规模”的计划,旨在收集其内容用于AI训练。据 Law360 报道,7月一名联邦法官在很大程度上拒绝驳回该案。存续主张包括 DMCA 指控,称 SerpApi 绕过了 Google 的反机器人保护。TikTok 不是当事方,该案涉及通过 Google 搜索结果抓取,而非私有移动 API。

数据行包括字幕、使用的音乐和各种复选框。数据中没有创作者用户名(handle)列,但记录显示了大量信息,包括字幕、话题标签和视频中提到的人。用户ID可在 Datasocial 中获取。该数据宝库已有同伴:Hugging Face 上还有一套45亿视频集的副本,也被描述为从 TikTok 移动 API 收集。该数据免费用于非商业用途,收集它的代码售价1,699美元。