FineWebデータ処理を実践
A Coding Hands-On on FineWeb for Streaming, Filtering, Deduplication, Tokenization, and Large-Scale Web Corpus Analytics

FineWebという大量のウェブデータを、効率的に処理し分析する方法を実践的に学べるチュートリアル。データ品質を高める技術が分かります。
このチュートリアルでは、高度なハンズオンワークフローを通じてFineWebデータセットを探索します。私たちは、数テラバイトに及ぶ完全なコーパスをダウンロードすることなく、データセットの管理可能なサンプルをストリーミングし、そのスキーマとメタデータを検査し、URL、language、language score、token countなどの主要なフィールドを分析します。また、FineWebの品質フィルタリングパイプラインの簡略版を再現し、MinHashベースの近傍重複検出を適用し、GPT-2 tokenizerでtoken countを検証し、ドメイン、language score、ドキュメント長、tokenizerの効率に関する有用な分析を生成します。Copy Code Copied Use a different Browser import subprocess, sys def pip(*pkgs): subprocess.run([sys.executable, "-m", "pip", "install", "-q", *pkgs], check=True) pip("datasets>=2.19", "datasketch", "tiktoken", "pandas", "matplotlib", "tqdm") import re, math, random, collections from urllib.parse import urlparse import pandas as pd import numpy as np import matplotlib.pyplot as plt from tqdm.auto import tqdm from datasets import load_dataset random.seed(0); np.random.seed(0) pd.set_option("display.max_colwidth", 90)私たちはまず、ストリーミング、分析、重複排除、tokenization、視覚化に必要なすべてのライブラリをインストールします。FineWebドキュメントを処理し、表形式データを扱うために必要な主要なPythonパッケージをインポートします。また、結果の一貫性を保ち、検査しやすくするために、乱数シードと表示オプションを設定します。Copy Code Copied Use a different Browser N_DOCS = 3000 print(f"Streaming {N_DOCS} docs from FineWeb sample-10BT ...") stream = load_dataset( "HuggingFaceFW/fineweb", name="sample-10BT", split="train", streaming=True, ) docs = [] for i, doc in enumerate(tqdm(stream, total=N_DOCS)): docs.append(doc) if i + 1 >= N_DOCS: break df = pd.DataFrame(docs) print("\nColumns:", list(df.columns)) print(df[["url", "language", "language_score", "token_count"]].head(5)) ex = docs[0] print("\n--- Example record (fields) ---") for k, v in ex.items(): preview = (v[:120] + "…") if isinstance(v,
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。