社外に出せない資料まで、AIに読ませたくなる。だが送信ボタンの手前で手が止まる。こういう経験はないだろうか?
中国のAI企業Z.aiが8月25日、新しいモデル「GLM-5.3」の重みをHugging Faceに置いた。重みはモデルの中身にあたる数値の集まりで、これが手に入れば自分のサーバでモデルを動かせる。公開から6日で6万6,195回ダウンロードされたこのモデルは、何ができるのだろうか。
Hugging Faceに出たのは重み一式
公開されたのはモデルの中身そのものだ。落として自分のサーバで動かせるが、7,533億パラメータを動かすだけの機材はいる。
Hugging Faceは、世界中の開発者がAIモデルを公開して持ち寄る場所だ。GLM-5.3のモデルページには、141個に分割された重みのファイルが並んでいる。ページに出ている規模は7,533億パラメータで、1ファイルに収まらないので分けて置かれている。
ページができたのは8月25日で、最後に更新されたのは8月31日だ。ダウンロードは6万6,195回、「これは見ておく」の印にあたるいいねは1,409件ついている。公開からまだ1週間もたたない。
モデルページの冒頭には、前の版GLM-5.2と同じ土台を使い、伸びはすべて追加学習によるものだとある。Z.ai自身の説明で、第三者が確かめた話ではない。
ターミナル作業のベンチで88.2点が出た
モデルページに載る成績では、端末の作業を課題にしたTerminal-Bench 2.1で88.2点だった。同じ表にはこれを上回る88.8点と88.3点のモデルも並んでおり、測ったのはZ.ai側で、編集部は動かしていない。
Terminal-Bench 2.1は、コマンドを打ってファイルを直したり環境を整えたりする作業をどこまでこなせるかを見る試験とされる。ページの注記によれば、点を出したときの道具立てにはClaude Codeを使っている。モデル単体の成績ではなく、エージェントの殻をかぶせた状態で測った数字だ。
Z.aiがページの冒頭に置いたのは、コーディングよりも先にサイバー分野の話だった。追加学習を進めるうちに、この分野の力が想定より速く伸びたという。脆弱性を見つけるCyberGymでは84.5点で、前の版の77.2点を上回った。見つけた欠陥を実際に突く試験では、前の版の2倍を超えたとしている。
開発の課題を集めたとされるDeep SWEでは66.9点が出た。どちらも売り手の自己申告で、第三者が同じ条件で確かめた数字ではない。もっとも重みが公開されている以上、同じ試験を自分で走らせて突き合わせる道は開いている。
動かす道は自前かクラウドか
動かす道は最初から2つある。重みを落として自前のサーバで走らせるか、他社のクラウド越しに呼び出すかだ。
モデルページには、推論を代行する会社が5社並ぶ。Z.ai自身のほか、Together、Novita、Fireworks、Basetenが載っている。ページに出ている速度は毎秒33トークンから86トークンまで開きがあり、いちばん速いのはBasetenだった。いずれも2026年8月31日時点の表示で、編集部が測った値ではない。
呼び出すときの指定も細かい。返答の前にどれだけ考えさせるかをlow、high、maxの3段から選べ、指定しなければmaxで動く。急ぎの用件とじっくり考えさせたい用件を、同じモデルで使い分けられる。外部の道具を呼び出す機能にも対応する。
141個に分かれた重みを誰でも落とせるなら、どのモデルを使うかという問いは、性能表を見比べる話から、どこに置いて動かすかの話へ移っていくのかもしれない。
出典
- zai-org/GLM-5.3 · Hugging Face(2026年8月25日公開、2026年8月31日更新。ダウンロード数、いいね数、速度、ベンチマークの点はいずれも2026年8月31日時点のページ表示)