まな先生解説
こころ質問
すい要点整理
結論:無料・約30分・3ステップでローカルLLMは動きます
| ステップ | 作業内容 | 所要時間 | 費用 |
|---|---|---|---|
| ① | Ollamaを公式サイトからインストール | 約5分 | 無料 |
| ② | モデルをダウンロード(例: gemma3:4b 約3GB) | 約10〜20分 | 無料 |
| ③ | ターミナルで対話して動作確認 | 約5分 | 無料 |
そもそもローカルLLMとは?クラウドAIとの違い

| 項目 | クラウドAI(ChatGPT等) | ローカルLLM |
|---|---|---|
| 月額費用 | 無料枠+有料プラン(Plusは月20ドル≒約3,000円) | 0円(電気代のみ) |
| データの扱い | 外部サーバーに送信される | PC内で完結 |
| オフライン利用 | 不可 | 可能 |
| 利用回数の制限 | プランにより有り | 無制限 |
| 最高性能 | ◎ 最先端 | ○ クラウド中位モデル相当 |
| 導入の手間 | ほぼゼロ | 約30分 |
導入すべき人・やめておくべき人
| こんな人は導入する価値が高い | こんな人はクラウドAIのままでいい |
|---|---|
| 顧客情報・契約書など外部に出せない文書を扱う | 扱うのは公開情報のみ |
| 要約や下書きを毎日何十回も回す | 使うのは週に数回 |
| 使用中のPCがメモリ16GB以上 | メモリ8GB未満の古いPC |
| ターミナルに1行打つことに抵抗がない | 設定作業そのものを避けたい |
| 月額課金を止めたい | 最高性能の回答が常に必要 |
補足
「オープンソースLLM」と一括りに呼ばれがちですが、正確にはモデルごとにライセンス条件が異なります。商用利用の可否は後述の「注意点・リスク」で必ず確認してください。
始める前の準備・必要なもの
| PCのメモリ | 動かせるモデルの目安 | 例 | 実用度 |
|---|---|---|---|
| 8GB | 〜4Bクラス | gemma3:4b、llama3.2:3b | 要約・下書きなら十分 |
| 16GB | 〜14Bクラス | gemma3:12b、qwen3:14b | 日常業務の主力になる |
| 32GB | 〜32Bクラス | gemma3:27b、qwen3:32b | クラウド中位に迫る品質 |
| 64GB以上 | 70Bクラスも視野 | llama3.3:70b | 本格運用・検証向け |
自分のPCのメモリを確認する手順
- Mac: 画面左上のアップルメニュー →「このMacについて」→ メモリの欄を見ます。ターミナル派なら `sysctl hw.memsize` でバイト数が出ます
- Windows: `Ctrl+Shift+Esc` でタスクマネージャーを開き、「パフォーマンス」タブ →「メモリ」を確認します
- 空き容量: Macは「設定 → 一般 → ストレージ」、Windowsはエクスプローラーの「PC」画面で確認します
- Mac(M1以降のApple Silicon)は相性が良い: メモリをGPUと共有する構造のため、追加投資なしで高速に動きます
- WindowsはNVIDIA GPUがあると数倍速い: VRAM8GB以上が目安。GPUがなくてもCPUだけで動作はします(速度は落ちます)
- ストレージ: モデル1個あたり2〜20GB。SSD搭載機を推奨します
| ツール | 操作方法 | 費用 | 向いている人 |
|---|---|---|---|
| Ollama | コマンド(API内蔵) | 無料 | 本記事の推奨。自動化もしたい人 |
| LM Studio | GUIで完結 | 無料 | 黒い画面を避けたい人 |
| llama.cpp | コマンド(細かい調整可) | 無料 | 上級者 |
導入手順を順番に詳しく解説(Ollama編)
- Ollamaをインストールする(約5分)
- 公式サイト(ollama.com)からOSに合ったインストーラをダウンロードします
- Macはdmgを開いてApplicationsフォルダへ、Windowsはexeを実行、Linuxはターミナルで `curl -fsSL https://ollama.com/install.sh | sh` を実行します
- ターミナル(WindowsはPowerShell)で `ollama --version` と入力し、バージョン番号が表示されれば成功です
- モデルをダウンロードして起動する(約10〜20分)
- `ollama run gemma3:4b` と入力します
- 初回は約3GBのダウンロードが自動で走ります。2回目以降は数秒で起動します
- メモリ16GB以上のPCなら `ollama run gemma3:12b` (約8GB)のほうが回答品質が明確に上がるのでおすすめです
- 動作確認する(約5分)
- プロンプトに日本語で「自己紹介を100字でお願いします」などと入力します
- 日本語の返答が返ってくれば導入完了です。対話の終了は `/bye` と入力します
- `ollama list` でダウンロード済みモデルの一覧、`ollama ps` で現在の稼働状況を確認できます
- (任意)ChatGPT風の画面にする
- Open WebUIを導入するとブラウザ上のチャット画面から使えます。チャット履歴の保存や文書読み込みもできて便利です
- GUIを最優先するなら、最初からLM Studio単体で完結させる方法もあります
- (任意)他のアプリやスクリプトから呼び出す
- Ollamaはインストールと同時に `http://localhost:11434` でOpenAI互換APIを公開します
- 既存の自動化スクリプトの接続先URLを差し替えるだけで、そのままローカルLLMに切り替えられます
Windows/Mac別の違いだけ先に押さえる
| 項目 | Mac(Apple Silicon) | Windows |
|---|---|---|
| インストール形式 | dmgをApplicationsへドラッグ | exeを実行(管理者権限不要) |
| 使うターミナル | ターミナル.app | PowerShell |
| GPU利用 | 自動(メモリ共有) | NVIDIA GPUなら自動、無ければCPU |
| モデル保存先 | `~/.ollama/models` | `C:\Users\<ユーザー名>\.ollama\models` |
| 体感速度の目安 | 16GB/12Bで7〜10文字/秒 | GPU有無で数倍の差 |
導入後の動作確認チェックリスト
- [ ] `ollama --version` でバージョン番号が表示される
- [ ] `ollama list` にダウンロードしたモデル名が出る
- [ ] 日本語で質問して日本語で返答が返る
- [ ] 返答が1文字ずつ止まらず、なめらかに出力される
- [ ] `/bye` で終了し、再度 `ollama run` で数秒起動する
つまずきやすいポイントと対処法
| 症状 | 原因 | 対処法 |
|---|---|---|
| 動作が極端に遅い・固まる | メモリ不足 | 4Bなど小さいモデルに変更。他のアプリを閉じる |
| 日本語が不自然・英語で返ってくる | 英語中心のモデルを選んでいる | gemma3・qwen3など日本語に強いモデルへ変更 |
| `command not found` と出る | アプリ未起動・PATH未反映 | Ollamaアプリを一度起動し、ターミナルを開き直す |
| ダウンロードが途中で止まる | 回線不安定・容量不足 | `ollama pull` は中断後も再開可能。空き容量を確認 |
| GPUが使われず遅い(Windows) | ドライバが古い | NVIDIAドライバを更新し、`ollama ps` でGPU使用率を確認 |
| ポート11434が使用中と出る | 既にOllamaが常駐している | 二重起動が原因。常駐アプリを終了してから再実行 |
| ディスク容量不足で失敗する | モデルが積み上がっている | `ollama list` で確認し `ollama rm モデル名` で削除 |
注意
「大きいモデルほど常に正解」ではありません。搭載メモリを超えるモデルはSSDへの退避(スワップ)が発生し、1文字ずつしか出力されない状態になります。モデルのファイルサイズが搭載メモリの半分程度に収まるのが快適さの目安です。
効率化・応用のコツ
- Modelfileで「自分専用モデル」を作る: 「あなたは校正者です。敬体で指摘してください」のような役割指示を焼き込んだモデルを `ollama create` で作れます。毎回同じ前置きを打つ手間がなくなります
- OpenAI互換APIで定型業務を自動化: 回数課金がないため、数百件のレビュー要約や商品説明文の一括生成のようなループ処理と相性抜群です。クラウドAPIなら数千円かかる処理も電気代だけで回せます
- Open WebUIのRAG機能で社内文書に答えさせる: 業務マニュアルやPDFを読み込ませると、その内容を根拠にした回答が得られます。「社内ルールに詳しいAI」を外部にデータを出さずに作れます
- 用途別にモデルを使い分ける: 切り替えはコマンド1行なので、複数常備が現実的です
| 用途 | おすすめモデル | 理由 |
|---|---|---|
| 日本語の文章作成・要約 | gemma3:12b | 日本語が自然で軽量 |
| コード補助 | qwen3系 | コーディング性能に定評 |
| 長文処理・指示の厳密さ重視 | gpt-oss:20b | 指示追従が安定(16GB以上推奨) |
注意点・リスク
- 商用利用はモデルのライセンス次第: QwenやOpenAIのgpt-ossのようにApache 2.0で商用利用しやすいモデルもあれば、LlamaやGemmaのように独自の利用条件・禁止事項が定められたモデルもあります。ビジネス利用の前に各モデルの公式ページ(モデルカード)を確認してください
- ハルシネーション(誤情報)はクラウドAIより出やすい: モデルが小規模なぶん、事実の誤りや古い情報が混ざる頻度は上がります。事実確認が必要な文書は人のチェックを前提にしてください
- マシン負荷と電気代: 推論中はCPU/GPUがフル稼働します。ノートPCでは発熱とバッテリー消費が大きく、長時間運用なら電源接続が前提です。電気代はフル稼働でも1時間あたり数円〜十数円程度が目安です
- APIを外部公開しない: Ollamaの接続先は初期設定のlocalhostのまま使ってください。設定を変えてネットワークに公開すると、第三者に無認証で利用される恐れがあります
- 「ローカル=何でも安全」ではない: 処理がPC内で完結しても、生成物の二次利用や個人情報の取り扱いには通常の法令・社内規程がそのまま適用されます
注意
法務・医療・税務など判断を伴う分野で、ローカルLLMの回答をそのまま顧客に提出するのは危険です。必ず専門家や一次情報での裏取りを挟んでください。
具体例・ケーススタディ
まとめ:今日の30分で「自分のAI」を持てます
よくある質問
Q1. 完全無料で使えますか?追加費用は発生しませんか?
Q2. ChatGPTとどちらが賢いですか?
Q3. インターネットなしでも使えますか?
Q4. 商用利用はできますか?
Q5. 古いPCしかない場合は諦めるべきですか?
Q6. Windowsでも同じ手順で導入できますか?
Q7. 導入したモデルを削除して容量を空けるには?
Q8. 会社のPCに勝手に入れても大丈夫ですか?
補足
モデルの世代交代は速く、半年単位で「同じメモリで動く賢いモデル」が登場します。導入後も `ollama pull` で新モデルを気軽に試してみてください。




