Profile
Back to NewsBack
GitHub Trending 8 min
Reader Mode
llm-jp/awesome-japanese-llm: 日本語LLMまとめ - Overview of Japanese LLMs

llm-jp/awesome-japanese-llm: 日本語LLMまとめ - Overview of Japanese LLMs

5 hours ago

日本語LLMまとめ

[English | Français | 日本語 ]

[!IMPORTANT]
📖 より読みやすいWeb版をご利用ください
> このREADMEの内容は、llm-jp.github.io/awesome-japanese-llm でより見やすい形式でご覧いただけます。表の表示崩れやレイアウトの問題を防ぐため、Web版の閲覧を推奨いたします。

この記事は、一般公開されている日本語LLM(日本語を中心に学習されたLLM)および日本語LLM評価ベンチマークに関する情報をまとめたものです。情報は、有志により収集されており、その一部は論文や公開されているリソースなどから引用しています。

::: warning 以下の点について、あらかじめご理解とご了承をお願いいたします

  1. 本記事の内容は、完全性や正確性を保証するものではありません。これらの情報は予告なく変更されることがあり、また最新の情報を常に提供できるとは限りません。
  2. 一部の情報は、推測や個々の利用者の解釈にもとづくものである場合があります。そのため、全ての読者にとって必ずしも正確であるとは限りません。
  3. 本記事に記載されているモデルの多くは、MIT や Apache-2.0 といったオープンソースライセンスが適用されています。しかしながら、一部のモデルには、非営利限定のライセンス(例:CC BY-NC-SA 4.0)や開発元特有のライセンスが適応されており、これらは必ずしもオープンソースとは言えない可能性がある点にご注意ください。
  4. 個人が開発したモデルに関する記述では、作成者の敬称は省略させていただいております。
:::

この記事の管理は GitHub で行っています。記事の間違いを発見した場合、あるいはモデルの追加提案を行いたい場合は、GitHub Issues 経由で報告していただけますと幸いです。

::: details 目次 {open} [[toc]] :::

テキスト生成に主に使うモデル

画像を含むテキスト生成モデルはこちら

スクラッチ学習モデル

汎用

| | 公開年 | アーキテクチャ | 入出力で扱える
トークン数 | 学習テキスト | 開発元 | ライセンス / 利用規約 | |:---|:---:|:---:|:---:|:---:|:---:|:---:| | Sarashina2-8x70B | 2024 | MoE
(8x70b (465b)) | 8,192 | Sarashina2 (70B) に対して Sparse Upcycling で学習 | SB Intuitions | Sarashina Model NonCommercial License | | LLM-jp-3 172B | 2024 | Llama
(172b, 172b-instruct2, 172b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | 事前学習済みモデル: LLM-jp-3 172B Terms of Use
事後学習済みモデル: llm-jp-3-172b-instruct3利用許諾契約 | | LLM-jp-3 172B beta2 | 2024 | Llama
(172b-beta2, 172b-beta2-instruct2) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta2 Terms of Use | | LLM-jp-3 172B beta1 | 2024 | Llama
(172b-beta1, 172b-beta1-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 0.7T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta1 Terms of Use | | LLM-jp-3 172B alpha | 2024 | Llama
(172b-alpha1, 172b-alpha1-instruct, 172b-alpha2, 172b-alpha2-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(alpha1: 計 0.7T トークン, alpha2: 計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | Apache 2.0 | | Stockmark-2-100B-Instruct-beta | 2025 | Llama
(100B-Instruct-beta, 100B-Instruct-beta-AWQ) | 4,096 | 事前学習: 計 1.5T トークン
Instruction Tuning
DPO | ストックマーク | MIT | | Stockmark-100b | 2024 | Llama
(100b, 100b-instruct-v0.1) | 4,096 | 事前学習: RedPajama, 日本語 Wikipedia, Japanese mC4, Japanese CommonCrawl, 日本語特許, Stockmark Web Corpus
(計 910B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | MIT | | PLaMo-100B-Pretrained | 2024 | Llama[^22]
(100b) | 4,096 | 事前学習: Japanese CommonCrawl, RefinedWeb, 独自のデータセット
(計: 2.0T トークン) | Preferred Elements (Preferred Networks) | PLaMo Non-Commercial License | | LLM-jp-3.1 | 2025 | Llama/MoE
(8x13b (73b), 8x13b (73b)-instruct4, 13b, 13b-instruct4, 1.8b, 1.8b-instruct4) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.5T トークン)
継続事前学習: インストラクション・レスポンスペア
(計 90B トークン)
SFT + DPO | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-3 MoE | 2025 | MoE
(8x1.8b (9.3b), 8x1.8b (9.3b)-instruct2, 8x1.8b (9.3b)-instruct3, 8x13b (73b), 8x13b (73b)-instruct2, 8x13b (73b)-instruct3) | 4,096 | LLM-jp-3 (1.8b, 13b) に対して Drop-Upcycling で学習 | 大規模言語モデル研究開発センター | Apache 2.0 | | Sarashina2 | 2024 | Llama
(7b, 13b, 70b) | 7b, 13b: 4,096
70b: 8,192 | 事前学習: Japanese Common Crawl, SlimPajama, StarCoder
(計 2.1T トークン) | SB Intuitions | MIT | | Sarashina1 | 2024 | GPT-NeoX
(7b, 13b, 65b) | 2,048 | 事前学習: Japanese Common Crawl
(計 1T トークン) | SB Intuitions | MIT | | Tanuki-8×8B | 2024 | MoE (47b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.7T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 | | LLM-jp-4 33B | 2026 | Llama
(33b-base, 33b-thinking, 33b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-33b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-4 32B-A3B | 2026 | Qwen3 MoE
(32b-a3b-base, 32b-a3b-thinking, 32b-a3b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-32b-a3b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | llm-jp-4-kappa | 2026 | Qwen3 MoE
(32b-a3b-v0.1) | 65,536 | LLM-jp-4 32B-A3B (thinking) に対して以下を実施
SFT: Nemotron-Cascade-2-SFT-Data, OpenMathReasoning, OpenCodeReasoning, Nemotron-SFT-Competitive-Programming-v2, llm-jp-4-thinking-sft-data など (計 443,747 件)
GRPO (数学): AceReason-Math から選別した 10,999 問
GRPO (コード): SYNTHETIC-2 から選別した約 3.1k 件 | Third Intelligence | Apache 2.0[^29] | | PLaMo 3 | 2025 | Gemma ベースのアーキテクチャ
(2b-base, 8b-base, 31b-base) | 4,096 | 事前学習: 英語、日本語、コード、多言語
(2b: 200B トークン, 8b: 1T トークン, 31b: 3T トークン) | Preferred Networks | PLaMo community license | | Way-PLaMo-3-8b-chat | 2025 | PLaMo 3ベース (8b-chat) | 4,096 | Instruction Following SFT: Alpaca (51.7K), Dolly-15k-ja (15K) | 個人 (WayBob) | PLaMo community license | | CyberAgentLM3 (CALM3) | 2024 | Llama
(22b-chat, 22b-chat-selfimprove-experimental) | 16,384 | 不明
(計 2.0T トークン) | サイバーエージェント | Apache 2.0 | | LLM-jp-3 13B instruct3 | 2025 | Llama
(150m, 150m-instruct2, 150m-instruct3, 440m, 440m-instruct2, 440m-instruct3, 980m, 980m-instruct2, 980m-instruct3, 1.8b-instrcut2, 1.8b-instruct3, 3.7b-instruct2, 3.7b-instruct3, 7.2b-instruct2, 7.2b-instruct3, 13b-instruct2, 13b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-3 13B | 2024 | Llama
(1.8b, 1.8b-instruct, 3.7b, 3.7b-instruct, 7.2b, 7.2b-instruct, 13b, 13b-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | Apache 2.0 | | llm-jp-3-3.7b-instruct-EZO | 2024 | Llama
(3.7b-instruct-EZO-Common, 3.7b-instruct-EZO-Humanities) | 4,096 | LLM-jp-3 (3.7B) に対して追加学習 | Axcxept | Apache 2.0 | | LLM-jp-13B v2.0 | 2024 | Llama
(13b-v2.0, 13b-instruct-full-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001_16x-dolly-ichikara_004_001_single-oasst-oasst2-v2.0) | 4,096 | 事前学習: llm-jp-corpus-v2
(計 260B トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2 | LLM-jp | Apache 2.0 | | Fugaku-LLM | 2024 | GPT
(13B, 13B-instruct, 13B-instruct-gguf) | 2,048 | 事前学習: 独自
Instruction Tuning: OASST1, Dolly Dataset, GSM8K | 東工大, 東北大, 富士通, 理研, 名大, サイバーエージェント, Kotoba Technologies | Fugaku-LLM Terms of Use | | LLM-jp-13B v1.1 | 2024 | GPT
(13b-instruct-lora-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-instruct-full-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-dpo-lora-hh_rlhf_ja-v1.1) | 2,048 | Instruction Tuning (LoRA or Full-parameter FT): Dolly Dataset, OASST1, ichikara-instruction
DPO (LoRA): HH RLHF | LLM-jp | Apache 2.0 | | LLM-jp-13B | 2023 | GPT
(1.3b-v1.0, 13b-v1.0, 13b-instruct-full-jaster-v1.0, 13b-instruct-full-jaster-dolly-oasst-v1.0, 13b-instruct-full-dolly-oasst-v1.0, 13b-instruct-lora-jaster-v1.0, 13b-instruct-lora-jaster-dolly-oasst-v1.0, 13b-instruct-lora-dolly-oasst-v1.0) | 2,048 | 事前学習: llm-jp-corpus (Wikipedia, Japanese mC4, The Pile, Stack) (計 300B トークン)
Instruction Tuning (Full-parameter FT or LoRA): jaster, Dolly Dataset, OASST1 | LLM-jp | Apache 2.0 | | PLaMo-13B | 2023 | Llama[^1]
(13b, 13b-instruct, 13b-instruct-nc) | base: 4,096
instruct, instruct-nc: 8,192 | 事前学習: C4, Project Gutenberg, RedPajama, 日本語 Wikipedia, Japanese mC4
(計 1.5T トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1, llm-japanese-datasetのwikinews subset (NCモデルでは商用利用不可の Alpaca Dataset も含めて学習) | Preferred Networks | Apache 2.0
(NC モデルは CC BY-NC 4.0) | | Stockmark-13b | 2023 | Llama
(13b, 13b-instruct) | 2,048 | 事前学習: 日本語 Wikipedia、Japanese CC-100、Japanese mC4、Japanese CommonCrawl、日本語特許、Stockmark Web Corpus
(計 220B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | baseモデル: MIT
instructモデル: CC BY-NC-SA 4.0 | | Weblab-10B | 2023 | GPT-NeoX
(10b, 10b-instruction-sft) | 2,048 | Japanese mC4 + The Pile(計 600B トークン)
\*instruction-sft モデルは Alpaca Dataset, FLAN でファインチューニング | 東大 松尾・岩澤研 | CC BY-NC 4.0 | | LLM-jp-4 8B | 2026 | Llama
(8b-base, 8b-instruct, 8b-thinking, 8b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO (thinking のみ): llm-jp-4-8b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | PLaMo 2.1 8B | 2025 | Samba ベースのアーキテクチャ
(8b-cpt) | 32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license | | PLaMo 2 8B | 2025 | Samba ベースのアーキテクチャ
(8b) | | 日本語、英語等のデータ
(計 6T トークン) | Preferred Networks | PLaMo community license | | Tanuki-8B | 2024 | Tanuki (8b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.3T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 | | Japanese StableLM Alpha | 2023 | GPT-NeoX
(base-alpha-7b, instruct-alpha-7b, instruct-alpha-7b-v2) | 2,048 | Wikipedia, Japanese CC-100, Japanese mC4, Japanese OSCAR, RedPajama
(+ 独自のデータセット)[^2]
(計 750B トークン)
\*instruct モデルでは Alpaca Dataset, Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subsetでファインチューニング
(v2では商用利用不可の Alpaca Dataset を除外) | Stability AI | baseモデル: Apache 2.0
instruct モデル (v1): 独自のライセンス
instruct モデル (v2): Apache 2.0 | | CyberAgentLM2 (CALM2) | 2023 | Llama
(7b, 7b-chat, 7b-chat-dpo-experimental) | base: 4,096
chat: 32,768 |一般公開されている日本語・英語のデータセット(詳細不明) (計 1.3T トークン)
*dpo モデルは Chatbot Arena Conversations JA (calm2) Dataset を用いて DPO で学習 | サイバーエージェント | Apache 2.0
(dpo モデルのみ CC BY 4.0) | | OpenCALM | 2023 | GPT-NeoX
(small, medium, large, 1b(1.4b), 3b(2.7b), 7b(6.8b)) | 2,048 | 日本語 Wikipedia
+ Jpanese mC4
+ Japanese CC-100 | サイバーエージェント | CC BY-SA 4.0 | | Stormy | 2023 | GPT-NeoX
(7b(6.8b)) | 2,048 | OpenCALM (6.8b) に対して
llm-japanese-dataset v0 のうち翻訳タスクを除いたデータで LoRAチューニング | 東大 和泉研 | CC BY-SA 4.0 | | ByGPT-JP | 2025 | Llama ベース
(multi-lm-head-6.5b-alpha) | 5,760 | llm-jp-corpus-v3 のサブセット (ja_cc, ja_warp_html, ja_warp_pdf, ja_wiki, kaken) | 東北大
自然言語処理研究グループ | Apache 2.0 | | rinna GPT
(英語やコードも含めて学習されたモデル)
| 2023 | GPT-NeoX
(4b(3.8b), 4b(3.8b)-8k, 4b(3.8b)-instruction-sft, 4b(3.8b)-instruction-ppo) | 8kモデル: 8,192
他: 2,048 | Wikipedia, Japanese CC-100, Japanese C4, RedPajama, The Pile
(計 524B トークン)
\8k モデルでは 4,000トークンを超える長いトークン列でファインチューニング
\
instruction-sft モデルでは HH RLHF、FLAN でファインチューニング
\*instruction-ppo モデルでは HH RLHF で PPO ベースの強化学習 | rinna | MIT | | japanese-large-lm | 2023 | GPT-NeoX
(1.7b, 3.6b, 1.7b-instruction-sft, 3.6b-instruction-sft) | 2,048 | 日本語 Wikipedia, Japanese CC-100, Japanese C4, Japanese OSCAR や独自データなど
(計 650GB)
\*instruction-sft モデルでは OASST1 でファインチューニング | LINE | Apache 2.0 | | rinna GPT
(日本語のみで学習されたモデル)
| 2023 | GPT または GPT-NeoX
(xsmall, small, medium, 1b, neox-small, neox-3.6b-instruction-sft-v2, neox-3.6b-instruction-ppo) | ≤ 2,048 | 日本語 Wikipedia
+ Japanese CC-100
(1b 以降のモデルでは
さらに Japanese mC4 を追加)
\instruction-sft, sft-v2 モデルでは HH RLHF、FLAN、SHP データセットでさらにファインチューニング
\
instruction-ppo モデルでは HH RLHF でさらに PPO ベースの強化学習 | rinna | MIT | | Sarashina2.2 | 2025 | Llama
(0.5b, 0.5b-instruct-v0.1, 1b, 1b-instruct-v0.1, 3b, 3b-instruct-v0.1) | 8,192 || SB Intuitions | MIT | | レトリバT5 | 2023 | T5
(small (short), small (medium), small (long), base (short), base (medium), base (long), large (short), large (medium), large (long), xl(3b)) | | 日本語 Wikipedia + Japanese mC4 | レトリバ | CC BY-SA 4.0 | | Spiral-RetNet-3b-base | 2024 | RetNet
(3b) | 2,048 | Wikipedia, Japanese CC-100, CulturaX | Spiral.AI | MIT | | kotomamba-2.8B | 2024 | Mamba
(2.8B-v1.0) | 2,048 | 日本語 Wikipedia, Swallow Corpus, SlimPajama | Kotoba Technologies | Apache 2.0 | | ABEJA GPT | 2022 | GPT または GPT-NeoX
(large, neox-2.7b) | | 日本語 Wikipedia
+ Japanese CC-100
+ Japanese OSCAR | ABEJA | MIT | | PLaMo 2.1 2B | 2025 | Causal decoder-only transformer
(2b-cpt) | 32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license | | Rakuten AI 2.0 mini | 2025 | Mistral
(mini(1.5b), mini(1.5b)-instruct) | 131,072 ||楽天|Apache 2.0| | 早大GPT | 2022 | GPT
(small, xl(1.5b)) | | 日本語 Wikipedia
+ Japanese CC-100 | 早大 河原研 | CC BY-SA 4.0 | | ストックマークGPT | 2023 | GPT-NeoX
(1.4b) | | 日本語 Wikipedia (0.88B トークン)
+ Japanese CC-100 (10.5B トークン)
+ 独自のWebデータ (8.6B トークン) | ストックマーク | MIT | | イエローバックGPT | 2021 | GPT-NeoX
(1.3b) | | 日本語 Wikipedia
+ Japanese CC-100
+ Japanese OSCAR | イエローバック | Apache 2.0 | | nanochat-jp | 2026 | nanochat (1b)
(v4-sft-hf, v3-sft-hf) | 2,048 | 事前学習: nanochat-jp-pretrain v4 / v3
SFT: nanochat-jp-sft | 東北大
自然言語処理研究グループ | Apache 2.0 | | PLaMo 2 1B | 2025 | Samba ベースのアーキテクチャ
(1b) | | 日本語、英語等のデータ
(計 4T トークン) | Preferred Elements (Preferred Networks) | Apache 2.0 | | Sarashina2.1-1B | 2024 | Llama
(1b) | 8,192 | Web 上などの日本語・英語データ(計 10T トークン) | SB Intuitions | Sarashina Model NonCommercial License | | colorfulscoop GPT | 2021 | GPT
(small) | | 日本語 Wikipedia | Colorful Scoop | CC BY-SA 3.0 | | 東工大GPT | 2023 | GPT
(medium, medium (逆方向)) [^3] | | 日本語 Wikipedia + Japanese CC-100 | 東工大 岡崎研 | CC BY-SA 4.0 | | 京大GPT | 2022 | GPT
(small (文字レベル), medium (文字レベル), large (文字レベル)) | | 日本語 Wikipedia (約2,700万文 (3.2GB))
+ Japanese CC-100 (約6億1,900万文 (85GB))
+ Japanese OSCAR (約3億2,600万文 (54GB)) | 京大 言語メディア研究室 | CC BY-SA 4.0 | | 日本語BART | 2023 | BART
(base, large) | | 日本語 Wikipedia (約1,800万文) | 京大 言語メディア研究室 | CC BY-SA 4.0 | | Megagon Labs T5 | 2021 | T5
(base) | | Japanese mC4 (87,425,304 ページ (782 GB))
+ Japanese wiki40b (828,236 記事 (2 GB)) | Megagon Labs
(リクルート) | Apache 2.0 |

ドメイン特化型

| | 公開年 | ドメイン | アーキテクチャ | 学習テキスト | 開発元 | ライセンス | |:---|:---:|:---:|:---:|:---:|:---:|:---:| | SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-32k-R0.1 | 2026 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] | | SIP-med-LLM/SIP-jmed-llm-3-8x13b-AC-32k-instruct | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 PMC-Patients 等を用いた Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | SIP-jmed-llm-3-8x13b-AC-32k-instruct Terms of Use[^25] | | SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-4k-base | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] | | SIP-med-LLM/SIP-jmed-llm-2-8x13b-OP-instruct | 2025 | 医療 | MoE | 医療系コーパス (44.2B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] | | SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1 | 2026 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] | | SIP-med-LLM/SIP-jmed-llm-3-13b-OP-4k-base | 2025 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] | | AscleLM-1-10B | 2026 | 医療 | Mamba-2 Hybrid
(Nemotron-H ベース) | 事前学習: Nemotron-CC v1 (約 6.3T トークン)、オープンソースの日本語・英語・中国語コーパス、コード・数学・推論データ (計 約 8.5T トークン)、および医学論文・医学書籍・診療ガイドライン・試験問題を由来とする合成データ | 東大 松尾・岩澤研 | AscleLM-1-10B Terms of Use[^27] | | 日本語対話Transformer | 2021 | 対話 |Transformer | Twitter 上の日本語リプライのペア | NTT | 独自のライセンス | | 日本語ニュースBART | 2023 | ビジネス | BART (base) | 日本語ビジネスニュース記事(約2,100万記事 (2.9億文)) | ストックマーク | MIT | | AcademicBART | 2023 | 学術 | BART (base) | CiNii の日本語論文 | 愛媛大 人工知能研究室 | Apache 2.0 |

海外モデルに日本語で継続事前学習を行ったモデル

※継続事前学習後に事後学習(SFT, DPO, RLなど)を行ったモデルも含みます

汎用

| | 公開年 | ベースのLLM | 学習テキスト | 開発元 | ライセンス / 利用規約 | |:---|:---:|:---:|:---:|:---:|:---:| | GPT-OSS Swallow 120B
(120B-SFT-v0.1, 120B-RL-v0.1, 120B-RL-v0.1-MXFP4) | 2026 | GPT-OSS (120b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 419.4B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | Llama 3.3 Swallow 70B
(70B-v0.4, 70B-Instruct-v0.4) | 2025 | Llama 3.3 (70b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1, Swallow-Code-v0.3-Instruct-style | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | Llama 3.1 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1, 70B-Instruct-v0.3) | 2024 | Llama 3.1 (70b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie | Swallowプロジェクト | Llama 3.1 Community License
(Instructモデルは Gemma Terms of Use も適用) | | cyberagent/Llama-3.1-70B-Japanese-Instruct-2407 | 2024 | Llama 3.1 (70b) | 不明 | サイバーエージェント | Llama 3.1 Community License | | Llama 3 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1) | 2024 | Llama 3 (70b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
Instruction Tuning: OASST1 [^17] | Swallowプロジェクト | Llama 3 Community License | | turing-motors/Llama-3-heron-brain-70B-v0.3 | 2024 | Llama 3 (70b) | Llama 3 Swallow 70B に対して追加学習(詳細不明) | Turing | Llama 3 Community License | | Llama 3 Youko 70B
(70b, 70b-instruct, 70b-gptq, 70b-instruct-gptq) | 2024 | Llama 3 (70b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 5B トークン)
Instruction Tuning: 独自のデータセット[^11] | rinna | Llama 3 Community License | | Swallow 70B
(70b-hf, 70b-instruct-hf, 70b-instruct-v0.1, 70b-NVE-hf, [70

... (README truncated for length)

Chat with me