AIしるべ
多数の専門モジュールから必要な経路だけを活性化する大規模MoEモデルのイメージ

Hy4 previewとは?770B MoE・料金・使い方を詳しく解説

Tencent Hy4 previewの770B/49B MoE、100万トークン、OpenRouter・vLLMでの利用方法、料金、ライセンス、日本語評価を解説します。

公開ウェイトのモデルを選ぶとき、「性能が高い」と「自社で現実的に動かせる」は別の話です。Hy4 previewは総770Bという巨大モデルで、100万トークンの文脈と実務タスクを強く意識しています。一方、モデルをダウンロードできることだけを見て、小規模なローカルAIと同じ感覚で導入すると、GPU、ストレージ、通信、運用費で行き詰まります。

Tencentは2026年8月28日、Hy4 previewを公開しました。本記事では、公式情報をもとにモデル構成、利用方法、性能の読み方、料金、ライセンス、日本語での評価手順を整理します。基本情報はHy4 previewのツールページでも確認できます。

Hy4 previewとは

Hy4 previewは、Tencent Hy Teamが開発したMixture-of-Experts(MoE)モデルです。モデル全体のすべてのパラメータを毎回使うのではなく、入力に応じて一部の専門家を選びます。

項目公式仕様
総パラメータ770B
アクティブパラメータ49B
レイヤー78
Routed Experts256
各トークンで使う専門家Routed 8+Shared 1
コンテキスト長1Mトークン
AttentionGated DSA
ライセンスApache License 2.0

主な対象は、ソフトウェア開発、文書・表計算・プレゼンテーション作成、ゲーム開発、科学研究です。モデルには投機的デコードのためのMTP層も組み込まれています。

多数の専門モジュールから必要な経路だけを活性化する大規模MoEモデルのイメージ

最初に誤解しやすい4つの点

1. 49Bだから49Bモデルと同じ設備で動くわけではない

49Bは、1トークンの計算で主に使われるアクティブパラメータです。保存・読み込み・配布するモデル全体は770Bであり、通常の49B密モデルと同じ容量ではありません。

2. 100万トークンは100万トークンすべてを正確に記憶する保証ではない

コンテキスト上限は入力できる長さです。重要な条件が文章の中央で失われないか、複数文書の出典を混同しないか、指示と参考資料を区別できるかは別に評価する必要があります。

3. ベンチマークの順位だけで本番品質は決まらない

Tencentは、163人の社内専門家による203件のエンジニアリングタスクのブラインド評価で、Hy4 previewがGLM-5.3とKimi K3をわずかに上回ったと発表しています。Hy4は平均2.99、GLM-5.3は2.92、Kimi K3は2.94でした。

ただし、これはTencentによる内部評価です。評価対象、プロンプト、採点基準、実行環境が自社の用途と同じとは限りません。「公式比較では優位だった」という参考情報として扱い、第三者評価と自社テストを待つのが安全です。

4. 公開ウェイトと無料運用は同じではない

Apache 2.0でモデルを利用できても、推論に必要なGPU、ストレージ、ネットワーク、監視、障害対応には費用がかかります。APIを使う場合も提供事業者ごとに料金、レート制限、データ条件が異なります。

Hy4 previewを使う4つの方法

WorkBuddy・CodeBuddyで試す

Tencentは、WorkBuddyとCodeBuddyで公開直後の2週間、Hy4 previewを無料提供すると案内しています。まず応答品質や用途との相性を見る方法として手軽ですが、キャンペーン終了後の条件を確認してください。

Tencent Cloud TokenHubを使う

Tencent Cloud経由でAPIとして利用できます。公式中国語ページでは、入力100万トークンあたり6元、出力18元、キャッシュヒット0.3元という価格が掲載されています。地域、通貨、契約、更新時期で条件が変わる可能性があるため、実際の請求画面を優先してください。

OpenRouterから呼び出す

OpenRouterを使うと、共通APIからHy4 previewへ接続できます。既存のモデル切り替え基盤へ組み込みやすい一方、Tencent Cloudの直接価格とOpenRouter上の価格は同じとは限りません。

vLLMまたはSGLangで自社配信する

公式リポジトリは通常版とFP8版のウェイトを提供し、vLLMとSGLangの導入例を掲載しています。公式のvLLM例はtensor parallel sizeを8に設定していますが、これは「8枚あればどのGPUでも十分」という意味ではありません。GPUの種類、メモリ容量、量子化、KVキャッシュ、同時リクエスト数で必要構成は変わります。

GLM-5.3・Kimi K3・Qwen3.8との違い

モデル特徴導入時に確認する点
Hy4 preview770B/49B MoE、1M文脈、Apache 2.0巨大な全体ウェイト、初期版の既知問題
GLM-5.3長期コーディングとセキュリティ用途API・公開ウェイト・価格の最新状況
Kimi長文処理とAgent用途利用地域、提供モデル、API条件
Qwen3.8-2.4T-A95B2.4T/95Bの公開ウェイト独自ライセンスとさらに大きい設備要件

最大モデルを選ぶ前に、同じ20〜50件のタスクを複数モデルへ実行し、成功率、再試行、出力トークン、待ち時間、総費用を比較してください。表示された単価が安くても、冗長な推論や失敗が多ければ総額は上がります。

日本語で評価するチェックリスト

コーディング

  1. 日本語のIssueを勝手に英訳して要件を変えないか
  2. 既存の命名規則とコメント言語を保てるか
  3. テスト失敗時に同じ修正を繰り返さないか
  4. 未確認の依存関係を追加しないか
  5. 変更範囲を説明し、差分を小さく保てるか

文書と分析

  1. 敬語、社内用語、固有名詞を保持できるか
  2. 日付、円、税込・税別、全角記号を正しく扱うか
  3. 複数文書の出典を混同しないか
  4. 未確認の数字を補完せず「不明」と書けるか
  5. 長い入力の中央にある重要条件を落とさないか

Agent実行

ツールを使わせる場合は、読み取りと変更の権限を分離します。送信、公開、削除、購入、権限変更は人間の承認を残し、APIキーや機密ファイルを会話へ直接渡さないでください。Open WebUIなどのUIを付ける場合も、モデルAPIをインターネットへ直接公開せず、認証、TLS、レート制限、監査ログを用意します。

Hy4 previewが向いているチーム

  • 大規模コードベースや複数文書を横断するAgentを評価したい
  • Tencent系サービスやOpenRouterですぐ比較したい
  • vLLM/SGLangを運用できる推論基盤チームがある
  • 公開ウェイトを使い、データ配置とモデル運用を管理したい

一方、ノートPCで簡単にローカルAIを試したい場合や、定型分類を低コストで大量処理したい場合は過剰です。OllamaLM Studiollama.cppで扱える小型モデルから始めた方が、評価と運用を短期間で回せます。

まとめ

Hy4 previewは、770B/49B MoE、100万トークン、Apache 2.0という構成で、コーディング、オフィス作業、科学研究を狙う大型の公開ウェイトモデルです。Tencent製品、OpenRouter、API、自社配信という複数の入口がある点も実用的です。

ただし、公開直後のpreviewであり、公式リポジトリは冗長に推論しやすいことや過度に自己検証する傾向を既知の制限として挙げています。まずAPIで自社の日本語タスクを評価し、品質と利用量が見合う場合だけ、自社配信の設備設計へ進むのが現実的です。

公式情報

執筆者

davie chen

2026/08/28

カテゴリー

ニュースレター

AIの最新情報を受け取る

新しいAIツールや活用ガイドをメールでお届けします