マルチモーダルモデル入門(技術評論社) [電子書籍]
    • マルチモーダルモデル入門(技術評論社) [電子書籍]

    • ¥3,960792 ゴールドポイント(20%還元)
    • ただいま予約受付中!2026年09月28日12:00:00からお読みいただけます

マルチモーダルモデル入門(技術評論社) [電子書籍]

栗田修平(著者)品川政太朗(著者)柳凜太郎(著者)塩野大輝(著者)高道慎之介(著者)仁泉大輔(著者)中村友彦(著者)八木拓真(著者)篠原崇之(著者)
価格:¥3,960(税込)
ゴールドポイント:792 ゴールドポイント(20%還元)(¥792相当)
フォーマット:
専用電子書籍リーダーアプリ「Doly」が必要です。無料ダウンロード
お届け日:ただいま予約受付中!
出版社:技術評論社
公開日時:2026年09月28日12:00:00からお読みいただけます。
お取り扱い: のお取り扱い商品です。
ご確認事項:電子書籍リーダーアプリ「Doly」専用コンテンツ
こちらの商品は電子書籍版です

マルチモーダルモデル入門(技術評論社) [電子書籍] の 商品概要

  • 本書は,画像や音声,動画など複数の異なるデータを扱う「マルチモーダルモデル」の入門書です。
    自動運転やロボット,AIエージェントといった存在が,実世界の複雑な情報を理解して人間と円滑にコミュニケーションをとるために必要とする最先端技術を,基礎知識からその仕組みまで体系的に解説します。共通基盤となるTransformerの基礎からはじめ,視覚・音声・動画・3次元データの各モデルにふれたうえで,画像・音声・自然言語の融合モデルを解説します。
    マルチモーダルモデルを用いた研究や開発に応用できる確かな力が身につく一冊です。
  • 目次

    第1章 マルチモーダルモデルへの基礎
    1.1 Transformer
    1.2 Transformerの処理単位としてのトークン
    1.3 LLMが獲得した能力
    1.4 LLMの学習手法

    第2章 Vision and Language
    2.1 視覚基盤モデルと視覚言語モデル
    2.2 大規模視覚言語モデルの基礎
    2.3 LLaVA
    2.4 LVLMの性能に寄与する要素
    2.5 LVLMの視覚トークンに関する内部分析
    2.6 LVLMの評価
    2.7 LVLMのリーダーボードと自動評価フレームワーク
    2.8 V&Lの課題と展望

    第3章 音データ
    3.1 音メディア処理の基礎
    3.2 ニューラルオーディオコーデック
    3.3 音声の基盤モデル
    3.4 音楽の基盤モデル
    3.5 可聴音一般の基盤モデル
    3.6 音と言語の基盤モデル
    3.7 音メディア処理全体の課題と展望

    第4章 動画データ
    4.1 動画データとは
    4.2 動画理解のタスク
    4.3 動画基盤モデル
    4.4 代表的な動画基盤モデル
    4.5 動画基盤モデルの学習
    4.6 データセットと評価
    4.7 動画基盤モデルのテクニック
    4.8 動画基盤モデルの課題と展望

    第5章 3次元データ
    5.1 3次元データとは
    5.2 LLM/VLM以前のマルチモーダル手法
    5.3 3DデータとLLMの統合技術
    5.4 VLMとの融合
    5.5 3Dデータの課題と展望

    第6章 オムニモーダルモデル
    6.1 複数モダリティ対応の基本
    6.2 NExT-GPTの学習
    6.3 オムニモーダルモデルの評価
    6.4 オムニモーダルモデルの課題と展望

マルチモーダルモデル入門(技術評論社) [電子書籍] の商品スペック

Cコード 3055
出版社名 技術評論社
紙の本のISBN-13 9784297158361
他の技術評論社の電子書籍を探す
ファイルサイズ 383.7MB
著者名 栗田修平
品川政太朗
柳凜太郎
塩野大輝
高道慎之介
仁泉大輔
中村友彦
八木拓真
篠原崇之
著述名 著者

    技術評論社 マルチモーダルモデル入門(技術評論社) [電子書籍] に関するレビューとQ&A

    商品に関するご意見やご感想、購入者への質問をお待ちしています!