1. 総括
Qwen3.8-27Bは、Qwen3.5のアーキテクチャを基盤とした27Bパラメータのデンス型ビジョン・言語モデルである。Hugging Face モデルカードによれば、コーディングや研究、エージェントタスクにおいて前世代から大幅な性能向上を実現している。
ネイティブで画像および動画の理解に対応している。思考制御も備える。
量子化版の性能については、4-bitのQ4_K_Mでは特定のベンチマークでフルモデルと同等の性能を維持できることが報告されている。一方、1-bitでは性能が著しく低下する。
コミュニティでは、Mac Studio等での実用性や、出力の冗長性、推論速度といった性質について議論されている。思考制御のデフォルト設定がトークン消費に与える影響についても言及されている。
2. ブンリンベンチ(ブンリンラボ独自テスト)
当ラボ独自の機械採点ベンチ「ブンリンベンチ」(出力契約・事実保持・指示追従・コードの罠など 7 部門)をローカル実機で実施した結果。手法はブンリンベンチについてを参照。
| 実測対象 | 試験版 | 総合 | 契約 | 数字 | 制約 | 伝聞 | コード | 非捏造 | 表題 | 速度 | 実測日 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| qwen3.8-27b-mtp(MacBook Pro (M5 Max, 128GB)) | ijiwaru-v1 | 35/41(85%) | 2/3 | 9/9 | 3/6 | 3/3 | 11/11 | 5/5 | 2/4 | 49.1 tok/s | 2026-09-03 |
実測環境:
- qwen3.8-27b-mtp — モデル: root4k/Huihui-Qwen3.8-27B-abliterated-oQ6e-mtp(MLX 版)。ランタイム: oMLX 0.6.4 (mlx 0.32.2, mlx-lm 0.31.3)。サンプリング: temperature 1 / top_p 0.95 / top_k 20 / min_p 0.08 / presence_penalty 0
3. 各種ベンチマーク
Hugging Face モデルカードに掲載されている数値は以下の通りである。
| カテゴリ | ベンチマーク | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
|---|---|---|---|---|---|---|
| Coding | Terminal Bench 2.1 | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| Coding | SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
| Coding | NL2Repo-Bench | 42.3 | 36.2 | 41.1 | -- | 47.6 |
| Coding | DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | -- | -- |
| Coding | QwenSWEBench | 79.0 | 49.3 | 59.2 | -- | 63.8 |
また、Artificial Analysisによる評価結果は以下の通りである。
| 指標 | 値 |
|---|---|
| Intelligence Index | 52 |
4. 公式の発表
- Hugging Face モデルカードによれば、Qwen3.8はQwenファミリーの中で最も能力の高い世代であるとしている。
- 同カードでは、Qwen Cloudによるホスト版の提供が「coming soon」と案内されている。
5. 実際の性能(コミュニティ評価)
Artificial Analysisは、同モデルがIntelligence Indexで52を記録したと報告している。一方で、出力が非常に冗長であることや、推論速度が47 tokens/sと低速である点も指摘された。
Hacker Newsの報告によれば、17GBのQ4_K_M量子化版はTerminal-Bench 2.1においてフルモデルと同等の性能を維持する。これにより、RTX 4090などの24GBビデオメモリを持つ環境でも、約64kトークンのコンテキストを保持したまま動作が可能だ。しかし、1-bitでは性能が著しく低下する。
Simon Willisonは、LM StudioなどでQ4_K_M版を試用した結果、デフォルトのreasoning_effort(xhigh)設定では、些細な問題に対しても大量のトークンを消費してしまうと述べている。
Terminal Bytesによれば、Mac Studioにおいてメモリ常駐によりスムーズな動作が可能であるという。同サイトでは、モデルがRSSフィードの要約やPDFのファイル整理といった日常的なタスクに活用されている事例が示された。
Redditのユーザーは、スクリーンショットを用いた自律的なコーディング能力の向上を述べている。また、Redditのユーザーは、Q4量子化版を用いてMinecraftのクローンを作成した事例を報告した。
llama.cppのリリースでは、KVキャッシュの復元に関する最適化が報告された。これにより、非連続なセルの復元にかかる時間が大幅に短縮される。また、引数 --tensor-read-lazy が --lazy-mode に変更された。
Redditのユーザーは、特定のファインチューン版において思考時間の短縮が性能低下を招いたと指摘する。一方、Redditのユーザーは2枚のR9700を用いた環境での速度について言及した。
また、Redditのユーザーはrepetition_penalty=1.0の設定について議論している。
6. おすすめパラメータ
- Hugging Face モデルカードに記載されている設定は以下の通りである。
- thinking mode: デフォルトでオン。リクエスト単位で無効化が可能。
reasoning_effort: 推論の深さを調整する。preserve_thinking: 履歴メッセージからの推論コンテキストを保持する。
7. 情報源
- Hugging Face モデルカード(公式)
- b10700(llama.cpp、2026-08-31)
- b10699(llama.cpp、2026-08-31)
- v0.6.16(MLX-VLM、2026-08-25)
- Qwen3.8-27B "Unhacked" my PC(Reddit r/LocalLLaMA、2026-09-06)
- God damnit buun, there’s no binaries on your site: A Pragmatic Guide to Local Agentic LLMs(Reddit r/LocalLLaMA、2026-09-06)
- Is 3090 + 5070 & 5060s a good idea?(Reddit r/LocalLLaMA、2026-09-06)
- NInfer vs llama.cpp vs vLLM: quality + speed comparison for Qwen3.8-27B NVFP4 on RTX 5090(Reddit r/LocalLLaMA、2026-09-05)
- AA Update! Here's how the Frontier ranks.(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8-27B on 2× RTX 5070 Ti 16GB — llama.cpp vs vLLM vs NInfer benchmarks(Reddit r/LocalLLaMA、2026-09-05)
- local vibecoding with Qwen 3.8 27B and Godot(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8 27B on Strix - the optimized setup(Reddit r/LocalLLaMA、2026-09-05)
- Which quant of qwen3.8 27b is the best for 16gb vram to get 100+ ctx and perfect for local Vibecoding?(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8 27b for agentic coding and next .... what?(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8-27B beat the Wikipedia game in 6 clicks.(Reddit r/LocalLLaMA、2026-09-05)
- Help me understand gguf size/ctx size(Reddit r/LocalLLaMA、2026-09-05)
- How to estimate tokens/sec for your hardware(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8 27B on RX 7900 XTX: Ollama ROCm vs llama.cpp Vulkan results(Reddit r/LocalLLaMA、2026-09-05)
- I benchmarked 21 Qwen3.8 27B variants on 16GB VRAM(Reddit r/LocalLLaMA、2026-09-05)
- Qwen3.8-27b is the first Local model im able to blindly trust(Reddit r/LocalLLaMA、2026-09-05)
- Even Qwen3.8 followed the instruction inside my translation data, and Gemma 4 beat the translation specialists I tested(Reddit r/LocalLLaMA、2026-09-04)
- We open-sourced Paddock, our Rust/C++ inference engine with its own CUDA kernels (MIT/Apache-2.0)(Reddit r/LocalLLaMA、2026-09-04)
- UPDATE: Qwen3.8-Flash-Next on 2x3090 + DDR4 (Part 2): 25-29 -> 37-41 t/s decode (UD-Q4_K_XL + expert cache + MTP), plus (Reddit r/LocalLLaMA、2026-09-04)
- Qwen 3.8 27B Vs. Qwen 3.6 27B on oMLX(Reddit r/LocalLLaMA、2026-09-04)
- Qwen3.8-27B at ~130 tok/s with full 262k context, on Kaggle's free TPU. OpenAI-compatible endpoint.(Reddit r/LocalLLaMA、2026-09-04)
- OrcaRouter、Google「Gemini 3.8 Flash」、Alibaba「Qwen3.8 Max」、Anthropic「Claude Fable 5.1」のフロンティアモデルを提供開始 - PR TIMES(Google News: Gemini、2026-09-03)
- Any more t/s maxxing I could do? 4060 TI 16GB, 32GB system RAM(Reddit r/LocalLLaMA、2026-09-03)
- MXFP4 quant for Qwen 3.8, llama.cpp supported?(Reddit r/LocalLLaMA、2026-09-03)
- Qwen3.8 27B Q8 hallucinated entire plan???(Reddit r/LocalLLaMA、2026-09-03)
- ZCode Desktop App seems make qwen3.8 better?(Reddit r/LocalLLaMA、2026-09-03)
- DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored is a disappointment(Reddit r/LocalLLaMA、2026-09-03)
- Mac Heads: Is there any point to MLX in September 2026?(Reddit r/LocalLLaMA、2026-09-03)
- Mushroom hunting with LLMs: what can go wrong?(Hacker News Frontpage、2026-09-03)
- Suggested Qwen 3.8 config is repetition_penalty=1.0 but in coding repetitions are normal so what?(Reddit r/LocalLLaMA、2026-09-03)
- First local-LLM tuning attempt: Qwen3.8-27B true Q4_K_M at 13.2 tok/s near 50-61K context on RTX 5080 16GB(Reddit r/LocalLLaMA、2026-09-02)
- Do we forget about another Qwen model for a while now ?(Reddit r/LocalLLaMA、2026-09-02)
- LLMs: Intelligence vs. Cost(Hacker News Frontpage、2026-09-02)
- Your favorite fastest abliterated/safety removed 3.6 and 3.8 27b?(Reddit r/LocalLLaMA、2026-09-02)
- How I got 280 tok/s on Qwen3.8 27B on 2xr9700's and 940k tokens kv cache(Reddit r/LocalLLaMA、2026-09-02)
- Kaitchup posted Qwen3.8 27B Benchmarks for quants from Q4 to Q1(Reddit r/LocalLLaMA、2026-09-02)
- Please help me decide my next hardware upgrade path(Reddit r/LocalLLaMA、2026-09-01)
- All currently popular local models in one table + Opus 4.8 results(Reddit r/LocalLLaMA、2026-09-01)
- I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.(Reddit r/LocalLLaMA、2026-09-01)
- Which current local models that can run within 128GB generate the best SVG pelicans?(Reddit r/LocalLLaMA、2026-09-01)
- Don't sleep on Vision support for coding!(Reddit r/LocalLLaMA、2026-09-01)
- b10724(llama.cpp、2026-09-01)
- The Chrono Trigger plot challenge - Crono awakens in his modest bedroom of 2095...(Reddit r/LocalLLaMA、2026-08-31)
- How bad do you think models like Qwen3.8-27B or GLM-5.3-Flash would be with H-Neurons disabled?(Reddit r/LocalLLaMA、2026-08-31)
- Does it make sense to quantize Qwen 3.8 myself when UD 3.0 exists?(Reddit r/LocalLLaMA、2026-08-31)
- How I got Qwen 3.8 27b running at ~75t/s decode on 16GB RTX 5080(Reddit r/LocalLLaMA、2026-08-31)
- OrcaRouter、1.5TB超の大規模LLM「GLM-5.3」を1台のMacで実行できる「GLM-5.3-MLX」を公開 - PR TIMES(Google News: MLX、2026-08-31)
- TencentがAIモデル「Hy4 preview」を公開、一部テストでGPT-5.6 Solを上回る&213GBまで軽量化した1bit量子化版も公開される(GIGAZINE、2026-08-31)
- Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results(Reddit r/LocalLLaMA、2026-08-31)
- 新「Mac mini」と「Mac Studio」を分析する ローカルAIで変わる位置付け【西田宗千佳のイマトミライ】 - watch.impress.co.jp(Google News: Mac mini LLM、2026-08-31)
- Some people said the Minecraft clone I fully vibecoded with Qwen3.8-27B Q4 is not that impressive because Minecraft is i(Reddit r/LocalLLaMA、2026-08-30)
- 無料でここまで作れる!MiniMax Music 3の音楽生成をローカル検証&解説 - YouTube(Google News: MiniMax、2026-08-29)
- Run Qwen3.8 27B locally: real numbers from my Mac Studio(HN 138pt・99コメント)(HN Search (backfill)、2026-08-29)
- OrcaRouter、Alibaba発LLM「Qwen3.8-Flash-Next」をベースにしたセキュリティ研究向けモデル「Qwen3.8-Flash-Next-Uncensored」を公開 - PR TIMES(Google News: MLX、2026-08-28)
- OrcaRouter、320B級オープンウェイトLLM「GLM-5.3-Flash」のApple Silicon向けMLX量子化版を「2-bit Lite」〜「6-bit」の5バリアントで公開 - PR TIMES(Google News: MLX、2026-08-28)
- Qwen3.8-Flash-Next がオープンソース化、DeepSeek 論文の n-gram を復活 - Pasquale Pillitteri(Google News: DeepSeek、2026-08-27)
- 評判がいいM5 Mac Studio。人気のスペック構成はどれ? - Gizmodo(Google News: Mac Studio LLM、2026-08-27)
- ローカルの Mac Studio は月200ドルの AI サブスクの代わりになるか - Pasquale Pillitteri(Google News: Mac Studio LLM、2026-08-27)
- Qwen3.8-Flash-Next(HN 701pt・233コメント)(HN Search (backfill)、2026-08-26)
- Qwen3.8 27B scores 52 on Artificial Analysis(HN 381pt・180コメント)(HN Search (backfill)、2026-08-18)
- Qwen3.8 27B at 256K: 50 TPS on a 24 GB GPU(HN 38pt・36コメント)(HN Search (backfill)、2026-08-17)
- Unsloth Qwen3.8-27B GGUF files(HN 69pt・5コメント)(HN Search (backfill)、2026-08-15)
- Qwen3.8-27B(HN 299pt・3コメント)(HN Search (backfill)、2026-08-15)
- Qwen 3.8 27B(HN 1438pt・793コメント)(HN Search (backfill)、2026-08-15)
- Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses(Hacker News Frontpage、2026-09-08)