浏览器本地表格工具

CSV 随机抽样与分组抽样

按数量、比例或分组抽样,用固定种子复现结果。在浏览器本地处理,核对结果后导出新副本。

文件内容在浏览器本地处理;刷新或关闭会清空会话。网页仍会请求静态资源。

1导入数据—2设置规则—3检查结果—4导出副本

把表格放在这里

拖放 CSV、TSV 或分隔文本文件

UTF-8 · 每份最多 10 MB

从现有数据开始

文件内容在浏览器内处理,不上传至服务器。
仅保存在本页内存 · 切换工具可继续使用 · 刷新或关闭会清除会话CSV / TSV · UTF-8
合成示例库 · 正常 / 边界 / 错误

清除本页会话?

这会释放已导入数据、处理步骤与结果。请先导出需要保留的副本。原始文件不受影响。

抽取可复现的完整记录

适合人工检查、演示与问题复现。按固定数量、百分比、每组固定数量或分组占比分配总数抽样。默认不重复选择同一来源记录,整行所有字段一起保留。相同内容可能来自两条不同记录,因此不保证样本没有业务重复,也不保证必然具有统计代表性。

明确输入、数量与分组

导入UTF-8 CSV/TSV或粘贴表格,确认解析后使用当前工作流数据。引号内换行仍属于一个逻辑记录,不会按物理文本行抽取。排序或筛选改变了输入与顺序,也会改变固定种子的结果。

数量要求整数。全表百分比按总记录数乘百分比后向下取整,例如25条的10%为2条。全表数量超过可用记录时阻止,不改成有放回抽样。0条是有效空样本。每组固定数量须选择数量模式,不能把全表百分比误当组内比例。

分组字段可以是多个。空值单列为空组,缺失与空字符串内部仍区分;不自动去空格或把NULL归为空。组内数量不足默认报告并阻止,只有明确选择取该组全部记录后才缩减该组配额,最终总数应查看计划。

占比分配如何保证总数

先计算各组精确份额,取整数部分,再按小数余量从大到小分配剩余名额。余量相同时使用组在当前输入中的首次出现顺序。不是每组各自四舍五入,因此实际总数等于请求总数。

三组规模34、33、33,总样本10,先各取3,共9,剩余1给余量最大的第一组,配额为4、3、3。分组计划展示可用、预计与实际数量;随机抽取发生在各组内部,不会跨组替补缺失的名额。

种子之外还要保存什么

随机种子、算法版本、输入内容与顺序、所有配置共同决定结果。设置报告记录算法版本、种子、输入条数、顺序约定与简短校验签名。该签名用于诊断,不是密码学完整性证明,不能单独证明两文件完全相同。

来源顺序会把已选记录按原先相对次序排列;抽取顺序保留抽取次序,分组模式先后访问按组首次出现顺序。改输出顺序不会重新抽取另一批记录。保存规则记录种子,但换文件或添加前置排序后不能仅凭相同种子期待相同记录。

完整检验例子

100条抽10条,来源标识必须恰好十个且互不重复。固定输入、配置、种子与版本,重复运行并导出,记录与顺序应一致。每组抽两条但A只有一条时,应报告不足;主动取该组全部后,A只输出一条,不能复制它补足两条。

预览只展示所选样本的前20条,完整导出须全量运行。来源映射保留每条记录的逻辑位置,原文件本来有两个同内容A时它们可以一起入样,来源身份仍不同。

导出与继续使用

可以导出样本、来源定位、分组计划和复现说明;ZIP不默认混入全部原始数据。共享CSV/TSV导出重新解析核对,公式防护影响数明确展示。用于复现解析错误时需保存同样的导出防护设置,否则保护前缀会改变原始文字。

应用到工作流后可继续处理子集;保存规则前检查字段名等敏感内容。更改设置使结果过期,取消停止任务,不返回半成品作为完整样本。规模与时长限制仍有效。切换语言不改变排序地区与数据,刷新或关闭清空内存会话,需事先下载样本与规则。

常见问题

怎么随机抽固定数量的行,又不重复抽到同一行?

选择按数量抽样,并确保数量不超过可用记录。工具不会重复抽同一条来源记录,但来源中内容相同的两行仍可能同时入选。想复现结果,需要保留输入顺序、规则和种子。

如何复现上次样本?

保存输入内容与顺序、种子、配置和算法版本,同时保留前置排序筛选步骤;只有同种子不够。

某组不够抽怎么办?

默认报告可用数量并阻止。如果接受该组较小样本,可主动选择取全部可用记录。

为什么样本有相同内容?

不同来源记录可以内容相同。工具防止重复选同一来源身份,不保证业务内容唯一。

按组占比是否保证代表性?

不保证。它按所选分组分布与配额规则抽取,其他特征、来源偏差和小样本仍可能影响适用性。