抽取可复现的完整记录
适合人工检查、演示与问题复现。按固定数量、百分比、每组固定数量或分组占比分配总数抽样。默认不重复选择同一来源记录,整行所有字段一起保留。相同内容可能来自两条不同记录,因此不保证样本没有业务重复,也不保证必然具有统计代表性。
明确输入、数量与分组
导入UTF-8 CSV/TSV或粘贴表格,确认解析后使用当前工作流数据。引号内换行仍属于一个逻辑记录,不会按物理文本行抽取。排序或筛选改变了输入与顺序,也会改变固定种子的结果。
数量要求整数。全表百分比按总记录数乘百分比后向下取整,例如25条的10%为2条。全表数量超过可用记录时阻止,不改成有放回抽样。0条是有效空样本。每组固定数量须选择数量模式,不能把全表百分比误当组内比例。
分组字段可以是多个。空值单列为空组,缺失与空字符串内部仍区分;不自动去空格或把NULL归为空。组内数量不足默认报告并阻止,只有明确选择取该组全部记录后才缩减该组配额,最终总数应查看计划。
占比分配如何保证总数
先计算各组精确份额,取整数部分,再按小数余量从大到小分配剩余名额。余量相同时使用组在当前输入中的首次出现顺序。不是每组各自四舍五入,因此实际总数等于请求总数。
三组规模34、33、33,总样本10,先各取3,共9,剩余1给余量最大的第一组,配额为4、3、3。分组计划展示可用、预计与实际数量;随机抽取发生在各组内部,不会跨组替补缺失的名额。
种子之外还要保存什么
随机种子、算法版本、输入内容与顺序、所有配置共同决定结果。设置报告记录算法版本、种子、输入条数、顺序约定与简短校验签名。该签名用于诊断,不是密码学完整性证明,不能单独证明两文件完全相同。
来源顺序会把已选记录按原先相对次序排列;抽取顺序保留抽取次序,分组模式先后访问按组首次出现顺序。改输出顺序不会重新抽取另一批记录。保存规则记录种子,但换文件或添加前置排序后不能仅凭相同种子期待相同记录。
完整检验例子
100条抽10条,来源标识必须恰好十个且互不重复。固定输入、配置、种子与版本,重复运行并导出,记录与顺序应一致。每组抽两条但A只有一条时,应报告不足;主动取该组全部后,A只输出一条,不能复制它补足两条。
预览只展示所选样本的前20条,完整导出须全量运行。来源映射保留每条记录的逻辑位置,原文件本来有两个同内容A时它们可以一起入样,来源身份仍不同。
导出与继续使用
可以导出样本、来源定位、分组计划和复现说明;ZIP不默认混入全部原始数据。共享CSV/TSV导出重新解析核对,公式防护影响数明确展示。用于复现解析错误时需保存同样的导出防护设置,否则保护前缀会改变原始文字。
应用到工作流后可继续处理子集;保存规则前检查字段名等敏感内容。更改设置使结果过期,取消停止任务,不返回半成品作为完整样本。规模与时长限制仍有效。切换语言不改变排序地区与数据,刷新或关闭清空内存会话,需事先下载样本与规则。
常见问题
怎么随机抽固定数量的行,又不重复抽到同一行?
选择按数量抽样,并确保数量不超过可用记录。工具不会重复抽同一条来源记录,但来源中内容相同的两行仍可能同时入选。想复现结果,需要保留输入顺序、规则和种子。
如何复现上次样本?
保存输入内容与顺序、种子、配置和算法版本,同时保留前置排序筛选步骤;只有同种子不够。
某组不够抽怎么办?
默认报告可用数量并阻止。如果接受该组较小样本,可主动选择取全部可用记录。
为什么样本有相同内容?
不同来源记录可以内容相同。工具防止重复选同一来源身份,不保证业务内容唯一。
按组占比是否保证代表性?
不保证。它按所选分组分布与配额规则抽取,其他特征、来源偏差和小样本仍可能影响适用性。