USD 24.91
ポイント: 119pt  (3%)  詳細はこちら
配送料 USD 20.42 9月9日 水曜日にお届け
詳細を見る
または 最も早い配送 8月27日 木曜日にお届け 詳細を見る
在庫あり。 在庫状況について
USD USD 24.91 () 選択したオプションを含めます。 最初の月の支払いと選択されたオプションが含まれています。 詳細
価格
小計
USD USD 24.91
小計
初期支払いの内訳
レジで表示される配送料、配送日、注文合計 (税込)。
出荷元 / 販売元
ギフトオプション
レジで利用可能
レジで利用可能 この商品はギフトです。変更
レジで、カスタムメッセージ、簡単返品のギフト領収書を追加して、商品をギフト包装することができます
支払い方法
お客様情報を保護しています
お客様情報を保護しています
Amazonはお客様のセキュリティとプライバシーの保護に全力で取り組んでいます。Amazonの支払いセキュリティシステムは、送信中にお客様の情報を暗号化します。お客様のクレジットカード情報を出品者と共有することはありません。また、お客様の情報を他者に販売することはありません。 詳細はこちら
次に追加されました:

申し訳ありません。問題が発生しました。

ウィッシュリストの取得中にエラーが発生しました。もう一度やり直してください。

申し訳ありません。問題が発生しました。

リストを利用できません。
Kindleアプリのロゴ画像

無料のKindleアプリをダウンロードして、スマートフォン、タブレット、またはコンピューターで今すぐKindle本を読むことができます。Kindleデバイスは必要ありません

ウェブ版Kindleなら、お使いのブラウザですぐにお読みいただけます。

携帯電話のカメラを使用する - 以下のコードをスキャンし、Kindleアプリをダウンロードしてください。

KindleアプリをダウンロードするためのQRコード

  • ゼロから作るDeep Learning ❹ ―強化学習編

著者をフォロー

新刊とおすすめタイトルの情報を入手
何か問題が発生しました。後で再度リクエストしてください。

ゼロから作るDeep Learning ❹ ―強化学習編

5つ星のうち4.6 (90)

{"desktop_buybox_group_1":[{"displayPrice":"USD 24.91","priceAmount":24.91,"currencySymbol":"USD","integerValue":"24","decimalSeparator":".","fractionalValue":"91","symbolPosition":"left","hasSpace":true,"showFractionalPartIfEmpty":true,"offerListingId":"d4Fn6EsSBbNBXTcAxfo234n5hB0RE6XcDtuXfmigsoOrSRJSnsPKm2%2FsJnOMa6Q7BfXrmY68eFk%2BCwRvkWVwTTt5LEA33q4GarRcKuZOPGjEzx8CbQicW7VeDAV7PSIX3jy%2BG7tqrzY%3D","locale":"ja-JP","buyingOptionType":"NEW","aapiBuyingOptionIndex":0}]}

購入オプションとあわせ買い

人気シリーズの第4弾。今回のテーマは強化学習です。実際のコードを提示し動かしながら学ぶという本シリーズのスタイルを踏襲し、外部ライブラリに頼らず、強化学習を支える基本的な技術やアイデアをゼロから実装しながら学びます。
本書では読者が強化学習独特の理論を確実にマスターできるように、強化学習という難解なテーマの構成要素の一つひとつを「理論」と「実践」の双方から丁寧に解説します。数式だけで説明する理論書とは異なり、読者はコードを通してハッとする気づきを数多く得られるでしょう。
最大12%ポイント還元:
紙書籍 真夏の涼読まとめ買いキャンペーン

よく一緒に購入されている商品

対象商品: ゼロから作るDeep Learning ❹ ―強化学習編
USD24.91
在庫あり。
この商品は、Amazon.co.jpが販売および発送します。
+
USD24.91
在庫あり。
この商品は、Amazon.co.jpが販売および発送します。
+
USD27.68
在庫あり。
この商品は、Amazon.co.jpが販売および発送します。
総額: $00
当社の価格を見るには、これら商品をカートに追加してください。
ポイントの合計: pt
詳細
追加されました
一緒に購入する商品を選択してください。

登録情報

  • 出版社 ‏ : ‎ オライリージャパン
  • 発売日 ‏ : ‎ 2022/4/6
  • 言語 ‏ : ‎ 日本語
  • 本の長さ ‏ : ‎ 376ページ
  • ISBN-10 ‏ : ‎ 4873119758
  • ISBN-13 ‏ : ‎ 978-4873119755
  • 商品の重量 ‏ : ‎ 1 g
  • 寸法 ‏ : ‎ 21 x 15 x 2.5 cm
  • Amazon 売れ筋ランキング: 本 - 24,852位 (本の売れ筋ランキングを見る)
  • カスタマーレビュー:
    5つ星のうち4.6 (90)

著者について

著者をフォローして、新作のアップデートや改善されたおすすめを入手してください。
斎藤 康毅
Brief content visible, double tap to read full content.
Full content visible, double tap to read brief content.

1984年長崎県対馬市生まれ。東京工業大学卒、東京大学大学院修士課程修了。現在は、株式会社Preferred Networksにて人工知能に関する研究開発に従事。

2017年ITエンジニア本大賞(技術書部門大賞)、2019年ITエンジニア本大賞(審査員特別賞)受賞。

著書に『ゼロから作る Deep Learning』シリーズ、翻訳書に『コンピュータシステムの理論と実装』『実践機械学習システム』『実践 Python 3』(以上、オライリー・ジャパン)などがある。

カスタマーレビュー

星5つ中4.6つ
90グローバルレーティング

日本からのトップレビュー

  • 星5つ中5つ
    E資格 勉強中
    2025年7月31日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    オライリー様万歳

    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中5つ
    強化学習が知識0からわかるが少しわかりにくいところもある
    2024年4月7日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    知識0から読んだが、丁寧に理論を説明し、実際に処理を0から書くのでとても面白い。

    ただ、少しわかりにくいなという説明や、なぜこうするのかの理由が納得できないところは少しあった。

    個人的にはもう少し難易度の低い入門書などと平行で読むのがおすすめ

    4人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中4つ
    わかりやすいです
    2024年12月26日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    難しい、強化学習についてわかりやすく解説してあるので、読み進められました。

    2人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中5つ
    本書の最大の価値は、強化学習の手法全体の関係性が俯瞰できること
    2023年10月8日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    この本の最大の価値は、強化学習におけるさまざまな手法の関係性に関して、非常に納得性の高い理解が得られるところにあると思う。

    その全容を下記にまとめたが、概略を述べると、モデルベースとモデルフリー、モデルフリーの中にはモンテカルロ法とTD法、TD法の中にはSARSAとQ(DQN)学習、DQNの中には、価値ベース・方策ベース・価値ベース+方策ベースの手法が存在する。

    A)モデルベース(環境モデル(状態遷移確率p(s’|s,a)、報酬関数r(s,a,s’))を使用する)

     ⅰ)環境モデルが既知

     DP法

      1)方策反復法

      2)価値反復法

     ⅱ)環境モデルを環境から得た経験により学習

      1)World Models

      2)MBVE (Model-Based Value Estimation)

    B) モデルフリー(環境モデル(状態遷移確率p(s’|s,a)、報酬関数r(s,a,s’))を使用しない)

     Ⅰ)価値ベースの手法

      1)モンテカルロ法 (図6-1)

       ①方策オン型

       ②方策オフ型

      2)TD法 (Temporal Difference) (図6-2)

       ① SARSA

        a)方策オン型のSARSA

        b)方策オフ型のSARSA

       ②Q学習

      3)DQN

      (DQNは、②Q学習の一種であるが、量が多いので、項目3)として設定する)

       ①経験再生(Experience Replay)

       ②ターゲットネットワーク(Target Network)

      ・DQNの拡張

       a)Double DQN

       b)優先度付き経験再生

       c)Dueling DQN

      ・DQNの発展版

      (ア)カテゴリカルDQN

      (イ) Noisy Network

      (ウ) Rainbow

      (エ) Ape-X

      (オ) R2D2

      (カ) NGU (Never Give Up)

      (キ) Agent57

     Ⅱ)方策ベースの手法(価値関数を経由に直接方策を求める)

      1)方策勾配法

      2)REINFORCE

      3)ベースライン付き方策勾配法

      4)A3C,A2C ((Asynchronous) Advantage Actor-Critic)

      5)DDPG

      6)TRPO,PPO

     Ⅲ)価値ベース+方策ベースの手法

      1)Actor-Critic

    14人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中5つ
    ベルマン方程式が根本的によくわからない方
    2022年9月3日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    どの本を読んでも理解できなかった理由がこの本でわかりました。ベルマン方程式がそもそもわからない方は、まずはこの本から!

    (*) udemyの強化学習講座[無料]をまず試聴してからだと、DP法手前までの道筋がたてやすいかも

    12人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中3つ
    シリーズ4作中で一番難しい
    2022年12月2日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    ゼロから作るシリーズの4作目で、強化学習についての書籍が出たので購入してみました。

    この本に限らず、強化学習関連の書籍は難しく感じます。

    というのも、実際に実務で試してみるという事が難しいという面があるからだと思います。

    ちょっとした迷路を解く事例(サンプルコード)等は載っていても、ロボットアームを制御させたりするような事例は紹介のみで、動く事例(サンプルコード)が少ないからです。

    実際のロボットアームの制御や、モータを制御して薬品吐出量を調整したり、センサデータを見て植物への最適な水やりを調整したりするような、身近な事例で、実際にコーディング可能な物が欲しいのですが、往々にしてそういった書籍は未だ見当たりません。

    そういう意味で、「ゼロから作る」と標榜している割に、理論が多くなってしまっていたので、少し評価を下げざるを得ませんでした。

    14人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中5つ
    強化学習の基礎から、簡単なゲームを解く強化学習の実装までを紹介
    2022年4月25日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.

    本書の前半1〜6章は強化学習の基礎(実装あり)を紹介し、後半の7〜9章でディープラーニングの強化学習問題を解くところまで(実装あり)を紹介。そして10章で更にその先の新技術(文章のみ)の紹介まで書かれている。

    強化学習の基礎は、以下の問題を実装を踏まえて解いていく。

    ・複数のスロットから勝率のいいスロットを見つけ出して報酬を最大にする問題

    ・小さなサイズ(縦3、横4ほど)のグリッドワールドにグリッドごとに果物(報酬)と爆弾(ペナルティ)が配置してあり、キャラクターがどのような行動(移動)をすれば報酬を最大にできるかの問題

    ディープラーニングの強化学習においては、オープンソースで提供されている強化学習用のライブラリに含まれているゲーム「カートポール」を題材に、より報酬が多くなる行動を強化学習させていく。最終的にはAtari(あのゲーム会社)のゲームを解く入り口(実装はなし、アドバイスまで 以降は読者の腕の見せ所)まで紹介してくれている。

    後半のディープラーニングを利用した強化学習においては、前作part 3で実装したフレームワーク「DeZero」を活用するため、本書のコンセプト(ゼロから作るというコンセプト)的には前作を読破しているのが望ましいと感じた。

    強化学習の基礎からじっくり中身を紹介してくれており、どうやってディープラーニングの中で強化学習を行なっているのか、適応しているのかその過程や中身を知りたい人に価値が出てくる著作だと感じた。

    以下、気になった内容メモ

    ーーーー

    ●1章 バンディット

    機械学習の区分:

     ・教師あり学習:入力と出力のペアデータ(画像、正解ラベル)を使って、入力から出力への変換方法を学習

     ・教師なし学習:正解ラベルなしのデータのみでデータに潜む構造を学習

       グループ分け(クラスタリング)

       特徴抽出

       次元削減

     ・強化学習:エージェント(行動する主体)が、ある環境に置かれ、環境の「状態」を観測し、それに基づき「行動」をする。その結果として環境の状態が変化し、エージェントは環境から「報酬」をもらうと同時に、「新しい環境の状態」を観測する。

    目標は、エージェントが得る報酬の総和を最大にする行動パターンを身に付ける事。

    >歩く学習の場合、進んだ距離が報酬。行動は、手足を動かす事。より効率のいい歩行方法を試行錯誤して自分で学習し最適解を求められる。

    バンディット問題

    複数のスロットマシーン(コインが出やすいのや、出にくいの色々ある)を使って、より多くのコインを増やす方法を考える問題。

     環境:スロットマシーン

     エージェント:プレイヤー

    報酬の期待値:価値

    行動に対して得られる報酬の期待値:行動価値

    スロットマシンのコインの出るランダム性>離散型の確率分布

     離散型確率分布:確率の摂る値がそれぞれの確率ごとに飛び飛びの値を持つこと

    もっとも期待値が大きいスロットマシンを選ぶのがベスト

    しかし、プレイヤーはスロットマシンの報酬の期待値をしることができない

    プレイヤーは、スロットマシンの価値(期待値)を精度よく測定することが求められる

    より多くプレイして得られた報酬の平均値(標本平均)を求める。

    活用:短期的視野で良いスロットを選びたいのなら、標本平均が大きいスロットを選ぶ

    探索:長期的視野で良いスロットを選びたいなら、色々なスロットを探索して試す必要あり

    活用と探索の良いバランスを取ることが重要:要パラメータ調整

    アルゴリズム:イプシロン・グリーディ法

     イプシロン(ε)=0.1で10%の確率で「探索」を行い、それ以外は「活用」を行う

    強化学習のアルゴリズム比較は、多くはランダム性があるので、一回の比較では正確性がない。>同じ実験をたくさん行い、その平均を比較するのが一つの方法

    バンディット問題は、以下に分かれる

    定常問題:スロット個体の勝率は固定

    非定常問題:スロットの個体の勝率が変わる

    過去に得た報酬ほど指数移動平均的に小さくなるようにすれば、非定常問題にも対応できるようになる。

    -----

    ●2章 マルコフ決定過程(MDP)

    エージェントの行動によって状況が変わる問題

    例:囲碁、将棋などの状況。エージェントの行動で盤上の配置が変わる

    MDPの具体例:

    小さなサイズのグリッド状(縦3、横4くらい)のマップに、フルーツ(報酬+1)や爆弾(報酬ー2)が配置されている。エージェントは、グリッドを移動してフルーツを取り、報酬が高くなる行動を学習する。

    エージェントの行動によって状態が変わることを、強化学習では「状態(state)」とよぶ。

    MDPには「時間」という概念が必要。ある時刻にエージェントが行動し、結果として新しい状況に遷移。この時の時間の単位は「タイプステップ」とよぶ。タイムステップ=エージェントが意思決定を行う間隔のこと。

    爆弾の向こう側にフルーツの山(報酬+6)がある場合など、は爆弾をとってフルーツの山を取る。

    エージェントは目先の報酬だけでなく、将来を見越して報酬の総和を最大化することが求められる。

    報酬を得るごとに状態が刻一刻と変化する。

    >例題では2マスのグリッドワールドの問題を解く

    エージェントの方策

    ・決定論的方策:ある状態では必ず同じ行動をする

    ・確率的方策:どの行動をするか確率で決定する

    分類

    ・エピソードタスク:終わりのある問題。囲碁、将棋など

    ・連続タスク:終わりのない問題。在庫管理など

    マルコフ決定過程では、最適方策が「決定論的方策」で必ず一つ存在する

    -----

    ●3章 ベルマン方程式

    マルコフ決定過程で成り立つ重要な方程式

    強化学習の問題を解くための重要な基礎を与えてくれる。

    無限に枝分かれしていくバックアップ線図のような

    無限に続く計算を有限の連立方程式に変換できる。

    ベルマン最適方程式:方策が最適であるという性質のみに特化した方程式

     ベルマン方程式よりシンプル

    -----

    ●4章 動的計画法

    3章までのベルマン方程式で連立方程式を明示して解けるのは小さな問題まで

    より大きな問題を解くためのものが動的計画法

    環境のモデル(状態遷移確率、報酬関数)が既知の場合に有効

    状態と行動の数がある程度大きくなっても解くことができる。

    >例題では2マスのグリッドワールドから、3*4マスのグリッドワールドへ進歩

    方策評価:ある方策が与えられたら、その価値関数などを求めること

    方策制御:方策を制御して最適方策を調整すること

    方策反復法:評価と改善の2フェーズを反復する

    価値反復法:評価と改善を融合させた手法

     上記二つは共に、グリッド上で報酬の取得をゴールとし、全てのグリッドでペナルティを避けた進行方向(方策)をとる最適方策を導き出せる

    -----

    ●5章 モンテカルロ法

    環境モデル(状態遷移確率、報酬関数)が未知でも有効な手法

    データのサンプリングを繰り返しおこなって、その結果から推定する手法の総称

    「状態、行動、報酬」の経験により価値関数を推定することができる

    分布モデル:確率分布として表されるモデル

    サンプルモデル:サンプリングさえできれば良いというモデル

    サンプルモデルを使って期待値を計算する場合は、たくさんのサンプリングをとってその平均値を取る。これがモンテカルロ法。

    サンプル数無限>大数の法則により平均値は正しい値に収束する

    モンテカルロ法で3*4マスのグリッドワールド問題を解く

    方策評価、方策制御において、動的計画法とほぼ同じの結果を導き出せる。

    -----

    ●6章 TD法

    モンテカルロ法は、エピソードタスクが終わりにたどり着いてからでないと、価値関数の更新ができない。エピソードの終わりになって初めて「収益」が確定するため。

    環境モデルを使わずに、行動ひとつごとに価値関数を更新するのがTD法。

    「今」と「次」の情報から価値関数を更新する。

    アルゴリズム

    ・SARSA:方策オン型の手法>方策オフ型に拡張もできる

    ・Q学習:方策オフ型の手法。重点サンプリングをせずにQ関数を更新でき、効率的に安定して更新できる>強化学習分野において重要なアルゴリズム

    -----

    ●7章 ニューラルネットワークとQ学習

    現実の問題は大きく複雑。

    チェスでさえ駒の並びパターンは10^123通りある。

    それらの状態をテーブルとして保持するのは現実的でない。

    そのテーブルひとつひとつの要素を独立して評価・改善していくのは現実的でない

    そこで、Q関数をコンパクトな関数で近似する。その有力な方法がディープラーニング

    ゼロから作るDeep Learning 3で実装したフレームワーク DeZeroを使用する。

    DeZeroの基礎、使い方

    線形回帰の実装

    ニューラルネットワークで非線形データの問題を解く

    ニューラルネットワークを使ったQ学習の実装

    >例として3*4のグリッドワールド問題を解く

    -----

    ●8章 DQN

    テレビゲームのような複雑なタスクもプレイできる

    新たに「経験再生」「ターゲットネットワーク」の技術が使われる

    OpenAI Gym

    強化学習のための学習材料(ゲームみたいなもの)の環境が用意されたオープンソースライブラリ

    DQNの経験再生、ターゲットネットワークを実装して、OpenAI Gymのゲームを強化学習する

    DQNの拡張

    ・Double DQN

    ・優先度付き経験再生

    ・Dueling DQN

    -----

    ●9章 方策勾配法

    価値ベースの手法:Q学習、SARSA、モンテカルロ法

    方策ベースの手法:方策勾配法, REINFORCE(方策勾配法の改良)

    価値ベースかつ方策ベース:Actor-Critic

    方策勾配法の実装

    RAINFORCEの実装、ベースライン技術による改善

    Actor-Criticの実装

    -----

    ●10章 さらに先へ

    方策勾配法系アルゴリズム

    ・A3C, A2C:分散学習を行うアルゴリズム

    ・DDPG:決定論的な方策を持つアルゴリズム

    ・TRPO, PPO:目的関数に制約を追加するアルゴリズム

    DQN系列のアルゴリズム

    ・Double DQN

    ・優先度付き経験再生

    ・Dueling DQN

    ・カテゴリカルDQN

    ・Noisy Network

    ・Rainbow

    深層強化学習の事例の紹介

    ・ボードゲームの学習

    ・ロボット制御

    ・NAS:ディープラーニングのアーキテクチャの自動設計

    ・自動運転

    ・半導体チップの生成

    -----

    付録A 方策オフ型のモテんカルロ法

    付録B nステップのTD法

    付録C Double DQNの理解

    付録D 方策勾配法の証明

    以上

    40人のユーザーが役に立ったと感じています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。
  • 星5つ中4つ
    素晴らしい
    2024年11月14日に日本でレビュー済み
    Brief content visible, double tap to read full content.
    Full content visible, double tap to read brief content.
    1人のお客様がこれが役に立ったと考えています
    フィードバックを送信中...
    フィードバックをお寄せいただきありがとうございます。
    フィードバックを送信中...
    ありがとうございます。数日中に調査いたします。