Topic Dispatch
マルチモーダル
タグ「マルチモーダル」の記事一覧
-
Gemini Omni Flash公開、動画APIの費用と統制 Gemini Omni Flashの公開プレビューを解説。日本の制作・プロダクトチームが、1秒0.10ドル、最大10秒・720p、会話型編集、C2PAとSynthID、固定quotaを踏まえ、短尺動画APIを安全に試す設計を整理する。
-
GitHub Copilot vision一般提供、画像・PDF統制の実務 GitHub Copilot visionが全プランで一般提供となり、VS Code、Web、CLIで画像・PDF添付が既定有効に。日本の開発組織が24時間保持、機密情報、モデル差、レビュー手順をどう管理するか整理します。
-
Gemini API File Searchが画像RAG対応、実装要点を整理 GoogleがGemini API File SearchをマルチモーダルRAGへ拡張。画像検索、メタデータフィルタ、ページ引用を、日本の開発・業務システムでどう使うか実務整理する。
-
Gemini Embedding 2でRAGは変わるか。日本実装要点を整理 Gemini Embedding 2の一般提供と4月30日の活用ガイドを踏まえ、マルチモーダルRAG・再ランキング・コスト最適化の実装要点を、日本の開発チームと事業会社向けに整理する。
-
Google「検索 Live」とは? 日本提供開始でAI検索は音声・カメラ時代へ——Gemini 3.1 Flash Liveの意味 Googleが2026年3月27日、日本で検索 Live を開始。Gemini 3.1 Flash Liveを軸に、音声とカメラで会話する検索が一般化し、開発者はLive APIから同系統の音声エージェントを構築できるようになった。
-
Alibaba Qwen3.5-Omni発表——テキスト・音声・映像を1パスで処理する「全方位AI」は何を変えるか AlibabaのQwenチームがオムニモーダルモデルQwen3.5-Omniを公開。113言語の音声認識、10時間超の音声処理、映像からのコード生成まで。Gemini 3.1 Proを複数ベンチマークで上回る性能の中身を解説。