SEOパイプライン

この記事では、Thinventが検索データからクエリページを生成する方法について説明します。当社のSEOパイプラインは、複数のソースからのクエリを処理し、クラスタリングし、製品とマッチングさせ、検索エンジン向けに最適化されたページを生成します。

データソース

複数のソースからクエリを集約します:

  • Google Search Console (GSC):インプレッション数とクリック数を含む自然検索クエリ

  • Google Ads:有料広告をトリガーした検索キーワード

  • Google Ads キーワードプランナー:検索ボリュームを含むキーワード候補

  • ライブクエリ:当社の検索サービスからのリアルタイム検索クエリ

これらのソースにより、ユーザーが何を検索しているかについて、履歴データとリアルタイムの洞察を組み合わせた包括的なビューが提供されます。

パイプラインアーキテクチャ

SEOパイプラインは毎週日曜日に実行され、11のステップで構成されています:

flowchart TD
    A[Step 0: ソースデータの埋め込み] --> B[Step 1a: GSC取得]
    A --> C[Step 1b: 広告データ取得]
    A --> D[Step 1c: キーワード取得]
    A --> E[Step 1d: ライブクエリ取得]
    
    B --> G[Step 2: クエリ統合]
    C --> G
    D --> G
    E --> G
    
    G --> H[Step 3a: 基本フレーズ生成]
    G --> I[Step 3b: クエリ埋め込み]
    
    H --> J[Step 4: フレーズマッピング拡張]
    I --> J
    
    J --> K[Step 5: クエリクラスタリング]
    I --> K
    
    K --> L[Step 6: ソースデータマッチング]
    A --> L
    
    L --> M[Step 7: クエリルーティング]
    J --> M
    K --> M
    
    M --> N[Step 8a: クエリページ構築]
    K --> O[Step 8b: 関連検索生成]
    
    N --> O[Step 8b: 関連検索生成]

ステップバイステップのプロセス

Step 0: ソースデータの埋め込み

製品データを SentenceTransformer を使用して埋め込み、セマンティックエンベディングを作成します。これらのエンベディングは、後でキーワードマッチングだけでなく、セマンティック類似性に基づいてクエリと製品をマッチングさせるために使用されます。

Steps 1a-1e: クエリ取得

複数のソースからクエリを取得します:

各ソースは、ユーザーの意図に関する異なる洞察を提供します。

Step 2: クエリ統合

すべてのクエリを単一のデータセットに統合し、インプレッション数やクリック数などの指標を重複排除して集約します。

Steps 3a-3b: フレーズ生成と埋め込み

製品の特徴から基本フレーズを生成し、SentenceTransformerを使用してクエリを埋め込みます。フレーズマッピングは、検索クエリからフィルターを抽出するために使用されます。

Step 4: フレーズマッピング拡張

以下の方法でフレーズマッピングを拡張します:

  • メモリ/ストレージの衝突解決(例:「8GB RAM」対「8GB storage」)

  • フレーズからフィルターへのマッピング構築

  • クエリからのn-gram抽出

Step 5: クエリクラスタリング

ベクトル類似性を使用して類似のクエリをクラスタリングします。セマンティック的に類似したクエリはグループ化され、同じクエリページを共有します。

Step 6: ソースデータマッチング

以下の方法でクエリと製品をマッチングさせます:

  • クエリエンベディングと製品エンベディング間のベクトル類似性

  • フレーズマッピングからのフィルター抽出

  • 製品名マッチング

Step 7: クエリルーティング

クエリを適切なページにルーティングします:

  • ファミリーマッチの検索(例:「Treo」ファミリー)

  • カテゴリーマッチの検索(例:「Mini PC」カテゴリー)

  • クエリページのスラッグ生成

Steps 8a-8b: ページ構築と関連検索生成

クエリページを構築し、関連検索を生成します:

  • Step 8a:製品リストを含むクエリページを構築

  • Step 8b:ベクトル類似性を使用して関連検索を生成

クエリページ生成

クエリページは /q/<slug> で生成され、以下を含みます:

  • タイトル:検索エンジン向けに最適化

  • 説明文:AI生成コンテンツ

  • 製品:トップマッチング製品

  • フィルター:クエリから抽出

  • 関連検索:セマンティック類似性マッチ

AIコンテンツ生成

クエリページコンテンツの生成にAIを使用します:

  • DeepSeek:製品説明、クエリページコンテンツ

  • システムプロンプト:キャッシュ効率化のため

  • Temperature:バランスの取れた創造性のために0.7

AIは以下を生成します:

  • タグライン:短く魅力的な見出し

  • 本文:詳細な製品情報

多言語サポート

クエリページは複数の言語をサポートします:

  • 英語(ソース)

  • スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語

  • ロシア語、ヒンディー語、ベンガル語、グジャラート語、カンナダ語

  • マラヤーラム語、マラーティー語、パンジャブ語、タミル語、テルグ語

  • アラビア語、中国語、日本語、韓国語

まとめ

当社のSEOパイプラインは以下を提供します:

  • 包括的なデータ:複数のクエリソース

  • セマンティックマッチング:より良いマッチングのためのベクトル類似性

  • AIコンテンツ:自動化されたコンテンツ生成

  • 多言語対応:15以上の言語をサポート

  • 自動化:チェックポイント付きの毎週のパイプライン