アンケートの自由回答、インタビューの文字起こし、営業メモ、問い合わせ記録。新規事業では、顧客の言葉があちこちに散らばります。担当者が一件ずつ読めるうちは、まだ何とかなります。件数が増えると、声の大きい一人の意見や、昨日聞いたばかりの発言に判断が引っ張られます。
テキストマイニングとは、文章を単語や文脈の単位に分け、頻度・関係・傾向を可視化する分析手法です。ただし、読まずに済ませるための技術ではありません。全体の偏りや見落とし候補を機械的に洗い出し、読むべき原文を絞り込むために使います。
単語の多さだけで「需要がある」と決めません。誰が、どの質問に、どんな状況で語ったのかまで戻ります。この二つを外すと、分析はただの色付き図表になります。
この記事では、テキストデータの探索と整理について、基本的な分析手法、6段階の進め方、無料で始める方法、新規事業での読み方を解説します。
テキストマイニングとは何か
テキストマイニングは、定型化されていない文章を分析可能な単位へ分け、語の出現、組み合わせ、似た内容、感情の傾向を探る手法です。数値データの集計とは違い、同義語、表記揺れ、否定、文脈をどう扱うかで結果が変わります。
「配送が遅い」「納品まで日数がかかる」「リードタイムが長い」。表現は違っても、同じ問題を指していることがあります。逆に「承認が遅い」と「画面表示が遅い」は、同じ「遅い」を含んでいても別の問題です。文章を分割して数え、辞書や分類規則で意味の近い表現をそろえ、最後は原文で文脈を確かめます。この往復が分析の実体です。
テキスト分析・自然言語処理・生成AIとの違い
実務では、テキスト分析を「文章から情報を取り出す作業全般」、自然言語処理を「単語分割や分類など、文章をコンピューターで扱う技術領域」として区別します。テキストマイニングは、これらを組み合わせて文章群から傾向を探る作業です。生成AIを分類案や要約案の作成に使う場合も、入力データから確認した事実と生成文は分け、回答ID、原文、処理条件を残します。
ワードクラウドだけでは分析にならない
頻出語を大きく表示するワードクラウドは、全体を眺める入口にはなります。けれど、「なぜその語が出たか」「誰が使ったか」「否定文だったか」までは読み取れません。
「不要」という語が大きく表示されたとします。「この機能は不要だ」なのか、「紙の申請が不要になった」なのかで、意味は正反対になります。頻出語を見つけたら、前後の語、該当原文、回答者条件まで確認してください。見栄えのよい図を作ることと、意思決定に使える証拠を作ることは、別の仕事です。
新規事業で使う場面
新規事業でテキストマイニングが効くのは、複数の顧客の声から、反復する困りごと、利用場面、制約、反対意見を探し、次に確かめる仮説を絞る場面です。市場規模や支払意思を、文章の頻度だけで確定する用途には向きません。
顧客の声は、集め方によって含まれる情報が違います。アンケートの自由回答は、同じ質問への回答を横に並べやすい形です。インタビューでは、行動の順序や背景まで聞けます。問い合わせ記録には、利用中に実際に起きた問題が残ります。異なるデータを一つに混ぜる前に、取得方法と対象者を区別してください。
データ | 探しやすいもの | 分析前に残す情報 | 読み違えやすい点 |
|---|---|---|---|
アンケート自由回答 | 評価理由、要望、自由記述の論点 | 設問、回答者条件、回答ID | 設問の言葉が回答へ反復する |
インタビュー記録 | 行動、判断理由、関係者、例外 | 質問ID、話者、発話ID、時刻 | 質問者の発言を顧客意見に混ぜる |
営業・商談メモ | 導入条件、社内調整、比較対象 | 商談段階、記録者、記録日 | 営業担当者の解釈が混ざる |
問い合わせ記録 | 利用中の障害、質問、解約兆候 | 製品、時期、対応結果、記録ID | 問い合わせない利用者が見えない |
実証実験の所感 | 使用場面、継続条件、改善要求 | 実施条件、利用期間、対象者ID | 試作版固有の問題を市場全体へ広げる |
探索で拾うのは、頻出する不満だけではありません。行動が止まる条件、いま使っている回避策、仮説を否定する発話。業種、役割、利用頻度といった属性差も見ます。ただし、出現回数は困りごとの強さも支払意思も示しません。代表原文と反対原文へ戻り、次のインタビューで発生場面と放置した結果を確かめます。
アンケート自由回答とインタビュー記録では、分析単位も、原文へ戻るためのIDも違います。取得方法ごとに表を分け、それぞれの条件を保ったまま分析してください。
顧客の声を読む主な分析手法
単語の頻度、語のつながり、文書どうしの近さ、分類、感情傾向。この5つを目的に応じて使い分けます。一つの分析図で結論を出さず、複数の見方で候補を絞り、最後は該当原文で意味を確かめます。
分析手法 | 分かること | 新規事業での用途 | 注意点 |
|---|---|---|---|
頻度集計 | 多く出た語や表現 | 話題候補、業務用語、反復する対象の発見 | 多い語が深刻な課題とは限らない |
組み合わせの分析 | 同じ文や発話で現れやすい語 | 「承認」と「上長」など状況の接続 | 共起だけでは因果関係を示さない |
特徴語の比較 | 特定属性で目立つ語 | 利用者と未利用者、役割別の差の探索 | 母数と質問条件をそろえる必要がある |
文書の類似・まとまり | 内容が近い回答群 | 大量の自由回答を読む順番の整理 | 自動で付いたまとまり名を鵜呑みにしない |
ルール分類 | 決めたコードへの振り分け | 課題、要望、停止条件の継続集計 | 辞書と除外条件の保守が要る |
感情傾向の判定 | 肯定・否定などの候補 | 不満の強い原文を探す入口 | 皮肉、否定、業界語で誤判定しやすい |
頻度集計は、どの語から原文を読むかを決める索引です。それ以上の意味はありません。語の組み合わせは状況を探る助けになりますが、同時に出た語だけで因果関係は示せません。分類用のコードには、定義、含める条件、除外条件、代表原文、境界事例を持たせ、自動分類の後に人が誤分類と未分類を確認します。
感情判定を使う場合も、肯定・否定の結果だけで顧客課題を確定しないでください。判定対象、辞書やモデルの条件、誤分類した原文を記録し、課題の発生場面は別途確かめます。
顧客の声を分析する6段階
手順は、意思決定の固定、データ棚卸し、分析単位の設定、前処理、探索、原文照合と次の検証の6段階です。ツールを選ぶのは、扱うデータと出力を決めた後になります。
1. 分析後に変える判断を一文で決める
「顧客理解を深める」では、いつ終わるのか誰にも分かりません。「次回の顧客インタビューで深掘りする課題候補を選ぶ」「実証実験の継続条件を見直す」。分析後の判断を書き、対象期間、対象者、含めないデータまで決めます。
2. テキストデータと利用条件を棚卸しする
データごとに、取得目的、取得方法、対象者、期間、保存場所、利用権限を記録します。個人名、企業名、連絡先など分析に不要な識別情報は、入力前に分離してください。外部ツールへ投入するなら、契約条件、保存、学習利用、削除、アクセス権を確認します。確認できないデータは入れません。
3. 一件の単位と属性をそろえる
アンケートなら一回答、インタビューなら一発話や一質問への回答。数える単位を決めます。各行にはデータID、質問ID、話者、取得日、属性、原文を置き、分析者のメモや要約は原文とは別の列にします。原文は上書きしません。
4. 表記を整え、分析辞書を作る
文字化け、不要な改行、明らかな転記ミスを直し、原本との差分を残します。同義語、表記揺れ、除外語、複合語は辞書にまとめます。「AI」「生成AI」「人工知能」をまとめるかどうかは、問いによって変わります。辞書の変更日と変更理由を記録しておけば、結果が変わった原因をたどれます。
5. 複数の方法で探索する
頻度、語の組み合わせ、属性別の特徴、類似回答のまとまりを順に見ます。分析結果には、使用データ、除外条件、辞書版、処理日を添えてください。生成AIで分類名や要約案を作るなら、入力した原文だけを根拠にさせ、各出力へデータIDを付けさせます。
6. 原文へ戻り、次の検証を決める
目立った語やまとまりから、代表原文と反対原文を読みます。確認できた事実、分析者の解釈、未確認事項を分け、次に誰へ何を聞くかを決めます。テキストマイニングの成果物は、頻出語を大きく表示するワードクラウドではなく、仮説、根拠ID、反証、次の検証を並べた意思決定メモです。
実行記録には、入力データ版、前処理ルール、辞書、ツールと設定、出力、分析者の修正、採否の理由を残します。同じデータを再分析したときに、結果の差を説明できる状態を目指してください。
無料で始める4つの方法と選定基準
無料で始める方法は、表計算ソフト、ローカル分析ソフト、Python・R、クラウドサービスの無料枠の4つに分かれます。選ぶときに見るのは料金ではなく、扱えるデータ量、原文追跡、辞書編集、再現性、情報管理です。無料で使えることと、機密性のある顧客データを投入してよいことは、まったく別の問題です。
候補を比べるときは、提供元の最新情報で、無料利用の条件、処理可能量、対応形式、辞書編集、原文追跡、保存、学習利用、削除、権限、商用利用、出力形式を同じ順番で確認します。確認日も記録しておくと、再評価のときに同じ土俵で比べられます。
無料で始める方法 | 向く場面 | 強み | 確認する点 |
|---|---|---|---|
表計算ソフトの無料プラン | 少量データの検索、手動分類、ピボット集計 | 原文と分類を同じ表で確認しやすい | 行数、共有権限、操作履歴、データ保存先 |
ローカルで動く無償分析ソフト | 頻度、語の関係、可視化を試す | データを端末内で扱える構成を選べる | 対応形式、辞書、更新状況、商用利用条件 |
Python・Rの無償ライブラリ | 定期分析、独自辞書、処理の再実行 | コードと設定を残しやすい | 実装担当、保守、ライブラリ更新、出力検品 |
クラウドサービスの無料枠 | 操作画面で短時間に試す | 初期設定を減らせる場合がある | 無料上限、保存、学習利用、削除、出力、権限 |
初回のコード候補作成や原文確認なら、表計算ソフトで足りることがあります。回答ID、原文、コード、判断理由、確認者を列に置き、分類規則のどこが曖昧かを探します。これだけでも収穫はあります。毎月繰り返すなら、同じ前処理と辞書を再実行できる方法へ移ります。
比較するときは、個人情報を除いた同一サンプルを各候補へ入れてください。前処理、辞書、出力、原文への戻りやすさ、修正にかかった時間を同じ確認表で並べ、誤分類を直せるか、結果の根拠を示せるかを見ます。
判断を誤る5つの原因
失敗は、頻度を需要と読み替えたとき、質問の偏りを無視したとき、異なるデータを混ぜたとき、原文を捨てたときに起きます。検品すべきは分析精度だけではありません。データが生まれた条件と、解釈の飛躍です。
頻出語を顧客課題の大きさとみなす
質問文に「価格」と書けば、回答にも価格という語が増えます。出現数は、質問や記録方法の影響を強く受けます。語の多さで優先順位を決めず、困った場面、発生頻度、現在の代替手段、放置した結果、支払意思を別の調査で確かめてください。
データの取得条件を混ぜる
自発的な問い合わせと、調査者が質問したインタビューでは、発言が生まれる条件が違います。利用者と未利用者、導入前と導入後、自由回答と商談メモを一つの母集団として数えると、割合の意味が崩れます。データ種別ごとに集計し、比較するときは差を注記します。
表記揺れと多義語を放置する
「管理者」「上長」「決裁者」を同じ概念へまとめると、役割の違いが消えることがあります。「重い」も、画面速度、作業負担、費用のどれを指すかで意味が変わります。同義語辞書は自動で確定させず、代表原文と除外例を見ながら更新してください。
AI要約を顧客の発言として引用する
生成AIが作った要約は、分析者側の加工物です。かぎ括弧に入れて顧客発言として使うなら、原文と完全に一致させ、発話IDを付けます。要約、解釈、示唆にはそれぞれ根拠IDを置き、原文にない因果や感情を補わないこと。
可視化が整った時点で分析を終える
色分けされた図が完成しても、次の判断が決まっていなければ仕事は終わっていません。「誰に追加で聞くか」「どの仮説を保留にするか」「何が確認できれば継続するか」まで書きます。その分析物を誰が読み、誰が決めるのかも明記してください。
テキストマイニングのよくある質問
始める前に決めるべきなのは、高価なツールを買うかどうかではありません。必要なのは、何を判断するための分析か、どの原文を根拠にするか、誰が分類を確定するかの三つです。小さなデータで分類規則と原文追跡を試してから、対象を広げます。
テキストマイニングは何件から始められますか
最低件数を一律には決められません。少量でも、辞書とコードブックの試作、分析単位の確認、質問の偏りの発見には使えます。ただし、数件の発話を市場全体の割合へ広げてはいけません。対象者条件と取得方法を明記し、探索結果として扱ってください。
テキストマイニングとアンケート集計は何が違いますか
選択式アンケートの集計は、用意した選択肢ごとの件数や割合を扱います。テキストマイニングは、自由回答など定型化されていない文章を分割・整理し、反復する表現や未知の論点を探します。実務では、選択式の集計と自由回答の原文確認を組み合わせます。
生成AIだけでテキストマイニングはできますか
分類案や要約案は作れます。ただし、生成AIの出力だけで分析を完結させないでください。入力範囲、指示文、出力版、回答IDを残し、引用の改変、否定の脱落、少数意見の消失を人が確認します。再現性が必要な集計は、固定した辞書や処理手順と組み合わせます。
まとめ|頻出語ではなく、次の検証を決める
テキストマイニングの成果は、頻出語の一覧ではありません。顧客の原文を根拠に、維持・修正・保留する仮説と、次の検証を決められる状態です。分析結果からデータIDと原文へ戻れないなら、意思決定の証拠としては弱いままです。
新規事業では、アンケート、インタビュー、商談メモ、問い合わせ記録を一括で混ぜず、取得条件を残して比較します。進め方は、分析後の判断を固定し、データと利用条件を棚卸しし、分析単位と属性をそろえ、表記と辞書を整え、複数手法で探索し、原文照合から次の検証を決める6段階です。
無料で始める方法を選ぶときも、機能数ではなく、原文追跡、辞書編集、再現性、情報管理を確認してください。
社内に溜まった顧客の声だけを読んでいると、既存の質問や分類規則の外にある論点を見落とします。分析で残った反対原文と未確認事項を明示し、必要に応じて社外の有識者や想定顧客へ追加で確かめます。社外の知見は自社仮説の正解として採用せず、反証候補を増やし、次の検証条件を具体化するために使います。
顧客の声分析シート
分析を始めるときは、次の5項目を一枚の作業シートにまとめてください。
- 分析後に変える判断
- 対象データ、取得条件、除外条件
- 分類規則、辞書版、更新日
- 根拠ID、代表原文、反対原文
- 次に誰へ何を確かめるか
