はじめての機械学習#4:代表的な機械学習アルゴリズム
機械学習には数多くのアルゴリズム(学習手法)が存在しますが、実務や学習の初期段階では、まず代表的なものの特徴と役割を押さえることが重要です。ここでは、ビジネスでもよく使われ、G検定などでも頻出の主要アルゴリズムをわかりやすく解説します。
線形回帰・ロジスティック回帰
線形回帰(Linear Regression)
線形回帰 は、もっとも基本的な回帰アルゴリズムで、「ある数値を予測する」ことを目的とします。
たとえば、
広告費から売上を予測する
気温から商品の需要を予測する
といった用途に使われます。
「入力(説明変数)」と「出力(目的変数)」の関係を直線で近似し、将来の値を予測するのが特徴です。計算がシンプルで、結果の解釈もしやすいため、機械学習の入門アルゴリズムとして広く使われています。
ロジスティック回帰(Logistic Regression)
ロジスティック回帰 は分類問題で使われるアルゴリズムです。
「購入する/しない」
「離脱する/しない」
「正常/異常」
のように、2値分類(Yes/No) で広く使われています。
名前に「回帰」とありますが、用途は分類であり、マーケティングや不正検知など、ビジネスの現場で非常によく活用されています。
決定木・ランダムフォレスト
決定木(Decision Tree)
決定木 は、「もし〜ならば〜」という判断ルールを木構造で表現するアルゴリズムです。
たとえば、
年齢は30歳以上か?
購買履歴はあるか?
地域は都市部か?
といった条件を順番に分岐させ、最終的な予測結果を導きます。
決定木の最大の特徴は、人間が判断の流れをそのまま目で確認できる点です。
そのため、説明性が高く、社内説明が必要な分析などで重宝されます。
ランダムフォレスト(Random Forest)
ランダムフォレスト は、複数の決定木を組み合わせて予測精度を高める手法です。
1本の決定木は分かりやすい反面、データのクセに引っ張られやすい(過学習しやすい)という弱点があります。
ランダムフォレストは、多数の決定木を“多数決”のように使うことで、この弱点を補います。
そのため、
精度が高い
安定した予測ができる
回帰・分類どちらにも使える
という特徴を持ち、実務での使用頻度は非常に高いアルゴリズムです。
サポートベクターマシン(SVM)
サポートベクターマシン(SVM) は、データを最もきれいに分離できる境界線(超平面)を見つけることで分類や回帰を行うアルゴリズムです。
特徴としては、
少ないデータでも高い精度を出しやすい
高次元データでも性能が落ちにくい
テキスト分類や画像認識の初期研究で多く使われた
といった点が挙げられます。
一方で、
パラメータ調整が難しい
大規模データには計算量が大きくなりやすい
といった弱点もあり、近年はディープラーニングに主役の座を譲る場面も増えています。
ニューラルネットワーク
ニューラルネットワーク は、人間の脳の神経回路をモデル化したアルゴリズムです。
「入力層 → 隠れ層 → 出力層」という構造を持ち、それぞれの層で情報が変換・伝達されていきます。
ニューラルネットワークの最大の特徴は、
複雑な非線形な関係を表現できる
画像・音声・自然言語などの難しい問題にも対応できる
という点です。
このニューラルネットワークの隠れ層を非常に多く重ねた(数層〜数百層)ものがディープラーニング です。
生成AIや画像認識、音声認識の中核技術は、すべてこの考え方の延長線上にあります。
ニューラルネットワークについてはこちらからどうぞ
機械学習アルゴリズムの特徴まとめ

機械学習アルゴリズムにはそれぞれ、
得意分野
扱いやすさ
精度
説明しやすさ
といった違いがあります。重要なのは、「最新だから優れている」「難しいから優れている」ということではなく、目的に応じて最適なアルゴリズムを選ぶことです。
ここまでお読み頂きありがとうございます。
AIって何? AIの歴史から最新情報まで、わかりやすく説明した、
これまでの記事(マガジン)の一覧をプロフィールページにまとめています。
AIの全体像をつかむヒントになると思いますので、ぜひご覧ください。
<前へ
はじめての機械学習#3|機械学習の代表的な学習方法「教師あり学習」「教師なし学習」「強化学習」
免責事項
・本記事は生成AI(ChatGPT等)を活用して執筆しています。内容の正確性・最新性には十分配慮しておりますが、誤りや古い情報が含まれる場合があります。ご利用・ご判断はご自身の責任でお願いいたします。万一、著作権等に問題がある場合はご連絡ください。
