#LLM
このタグが付いた記事
Index
count=43- AI / MLtheme: テクノロジー
Meta、コード特化 Muse Spark 1.1 を公開
Meta Superintelligence Labs は 7 月 9 日、コーディングとエージェント処理に特化した新モデル「Muse Spark 1.1」を公開した。Meta AI 責任者の Alexandr Wang は複数のエージェント系ベンチマークで GPT-5.5 や Claude Opus 4.8 に並ぶ性能とし、API 料金は入力 100 万トークンあたり 1.25 ドル、出力 4.25 ドル。
- AI / MLtheme: テクノロジー
Anthropic、Claude 利用制限を全ユーザーへ即日リセット GPT-5.6 公開と同日
Anthropic は 7月9日 (米国時間)、Claude ユーザー全員に対し 5 時間ごと・週次のレートリミットを即日リセットした。OpenAI が GPT-5.6 と ChatGPT Work を発表した同日というタイミングで、Opus 4.8 が subagent を過剰生成して枠を消費していた不具合修正も併記。競合との消耗戦を象徴する動きになった。
- AI / MLtheme: テクノロジー
OpenAI「GPT-5.6 Sol/Terra/Luna」7月9日プレビュー公開 ⇒ Sol は $5/$30、サイバー特化
OpenAI は GPT-5.6 シリーズの三モデル「Sol / Terra / Luna」のプレビューを公開し、7月9日 (米国時間) から広範な一般提供を開始すると発表。6月の 20 社限定プレビュー (既報 6月26日) を経て、米政府主導の顧客別承認から標準リリースに移行します。
- AI / MLtheme: テクノロジー
xAI・Cursor 共同開発「Grok 4.5」7月9日一般公開 ⇒ Opus 級を $2/$6 で提供
Elon Musk 率いる xAI は Cursor と共同開発したフラグシップ AI モデル「Grok 4.5」を 7月9日 (米国時間) に一般公開すると発表。6月の $600 億買収合意後の初の共作で、Anthropic Claude Opus 4.8 級性能を入力 $2 / 出力 $6 per 1M tokens の低価格で提供します。
- AI / MLtheme: テクノロジー
中国製 AI モデル、OpenRouter で最大 46% ⇒ DeepSeek 17.6% 首位、米企業のトークン消費が中国系へ大きくシフト
CNBC が 7 月 7 日に報じた OpenRouter 集計データによると、米国企業が同ルーティング基盤で消費するトークンのうち、中国製 AI モデルが 2 月 8 日以降 30% 超を維持し、直近では最大 46% に達しました。前 12 か月平均は 11% で、DeepSeek 単独では 17.6% を占め首位に立ちます。オープンウェイト中国モデルの価格が米国製の 6-9 割安である点が最大要因です。
- AI / MLtheme: テクノロジー
Tencent、Hunyuan「Hy3」を Apache 2.0 で公開 ⇒ 295B MoE / 21B active / 256K context
Tencent は 7月6日、Hunyuan シリーズの新型オープンモデル「Hy3」を Apache 2.0 ライセンスで公開しました。総 295B パラメータの MoE で 21B active、256K コンテキストの hybrid fast/slow-thinking 型。初日から Hugging Face・ModelScope で配布され、OpenRouter でも 7月21日頃まで無償 API 呼び出しが可能。Preview 版比で hallucination 12.5% ⇒ 5.4% に低下と主張しています。
- AI / MLtheme: テクノロジー
Anthropic Claude Fable 5、7月7日から usage credits へ切替 ⇒ Pro/Max の一時同梱終了
Anthropic は 7月1日に再展開した Claude Fable 5 について、Pro / Max / Team / 一部 Enterprise 向けに提供していた「週次上限の 50% まで利用可」の同梱期間を 7月7日で終了しました。7月8日以降、Fable 5 は usage credits (メータ課金) 経由でのみ利用でき、API 料金は入力 $10 / 出力 $50 (per MTok)、現行モデル中最も高価な位置付けとなります。
- セキュリティtheme: テクノロジー
新型モジュラー型マルウェア「Avalon」、CrownX ランサム機能と LLM 経由の C2 を統合
The Hacker News は 7月3日、これまで未報告のモジュラー型マルウェアフレームワーク「Avalon」を報じました。認証情報窃取・横移動・回復妨害・ランサム化 (CrownX) をワンストップで実行し、C2 は攻撃者の自然言語を Groq の公開 LLM API でシェルコマンドに変換する新設計です。
- AI / MLtheme: テクノロジー
Meta の次期基盤モデル「Watermelon」、GPT-5.5 に追いつく ⇒ Wang CAO が社内 town hall で説明
Meta の Alexandr Wang チーフ AI 責任者は 7月2日の社内 town hall で、訓練中の次期モデル「Watermelon」が主要ベンチマークで OpenAI GPT-5.5 に並んだと従業員に伝えました。前モデル Avocado と比べて計算量は 10 倍規模で、コーディングと agentic 能力の底上げを狙います。
- セキュリティtheme: テクノロジー
Palo Alto Unit 42 が "phantom squatting" 警告 LLM が創作した架空ドメインを攻撃者が先取り登録
Palo Alto Networks Unit 42 は LLM が幻覚で吐き出す実在しないドメインを攻撃者が先回りで登録しフィッシング拠点化する新手法 "phantom squatting" を報告しました。913 ブランドを対象とした調査で 210万 URL が生成され、うち約 25万件が未登録で狙われうる状態にあります。
- AI / MLtheme: テクノロジー
Meituan、1.6T パラメータの LongCat-2.0 を OSS 公開 ⇒ 国産チップで学習
中国 Meituan が agentic coding 向け 1.6 兆パラメータのオープンモデル LongCat-2.0 を公開。事前学習・推論ともに国産 AI アクセラレータで完結したと主張し、SWE-bench Pro で GPT-5.5 を上回る数値も報告。
- AI / MLtheme: テクノロジー
Anthropic、Claude Sonnet 5 を投入 ⇒ エージェント運用の低価格化を狙う
Anthropic が中位モデル Sonnet 5 を発表。エージェント性能で Opus 4.8 に迫りつつ、入力 2 ドル / 出力 10 ドル (100 万トークン) の導入価格で agent ワークロードのコスト削減を狙う。
- AI / MLtheme: テクノロジー
Sakana AI「Sakana Fugu」公開 複数モデルを束ね Mythos 超え謳う
東京の Sakana AI が複数 AI モデルを協調動作させるマルチエージェントシステム「Sakana Fugu」と上位版「Fugu Ultra」を 6 月 22 日に一般提供開始。一部ベンチマークで Claude Mythos Preview や Fable 5 を上回ると主張する。
- AI / MLtheme: テクノロジー
元 OpenAI 組「In the Weights」公開、AI 知名度を可視化
TechCrunch は 6 月 20 日、元 OpenAI の Thomas Dimson 氏と Joey Flynn 氏が立ち上げた「In the Weights」を取り上げました。Web 検索を介さず Grok / Gemini / GPT / Claude / Llama 等が自分や任意の人物をどれだけ「思い出せる」かを採点する、LLM 時代のエゴサ的サービスです。
- AI / MLtheme: テクノロジー
Z.ai が GLM-5.2 をオープンウェイト公開、コーディングで GPT-5.5 を上回る
中国 Z.ai が 6 月 16 日、長期コーディングタスク向けに最適化した 753B パラメータの LLM「GLM-5.2」を MIT ライセンスでオープン公開し、Artificial Analysis のオープンウェイト総合首位に立ちました。
- AI / MLtheme: テクノロジー
IBM、LLM 駆動の進化アルゴリズム OpenEvolve で量子誤り訂正符号 465 件を発見
IBM Research は 6 月 13 日、LLM を仮説生成器に据えた進化アルゴリズム フレームワーク「OpenEvolve」を公開し、これを使って量子誤り訂正 (QEC) 符号の候補 465 件を発見したと発表しました。AlphaEvolve や FunSearch の系譜に連なる手法で、ライブラリは GitHub にオープンソース公開されています。
- AI / MLtheme: テクノロジー
Mistral AI、€30 億調達協議で評価額 €200 億 欧州 AI の主役狙う
仏 Mistral AI が新たに €30 億 (約 $35 億) を調達する協議に入ったとブルームバーグが 6 月 12 日に報じました。評価額は約 €200 億で、2025 年 9 月の Series C 時点 €117 億から半年余りで約 2 倍。米中勢との計算資源競争に投入する見込みです。
- AI / MLtheme: テクノロジー
Anthropic、Mythos 級「Claude Fable 5」を一般公開 SWE-Bench Pro で 80.3%
Anthropic は 6 月 9 日、これまで限定公開だった Mythos 級モデルを一般化した「Claude Fable 5」を発表。SWE-Bench Pro で 80.3% を達成し、サイバー / 生物・化学領域では Claude Opus 4.8 へ自動フォールバックする安全機構を内蔵する。
- AI / MLtheme: テクノロジー
Microsoft、自社製推論モデル MAI-Thinking-1 を公開
Microsoft AI が Build 2026 で初の自社製推論モデル MAI-Thinking-1 を発表。OpenAI 由来の蒸留に頼らず一からトレーニングし、AIME 2026 で 94.5%、Sonnet 4.6 を上回る人手評価結果を示した。
- AI / MLtheme: テクノロジー
MiniMax、中国A株上場へ ARR 3億ドル超で猛追
中国の AI スタートアップ MiniMax が上海証券取引所への A 株上場に向けた指導届出を提出。ARR は 3 億ドルを超え、Hong Kong に続く 2 拠点目の上場で AI 大規模モデル分野の A 株第 1 号を Zhipu と競う。
- AI / MLtheme: テクノロジー
リコー、図表入り日本語 LLM 評価ベンチ公開
リコーは図表を含む日本語業務文書に対する LLM の多段推論能力を評価するベンチマーク JDocQA Reasoning Benchmark を無償公開。全 1,287 問、20 種類以上の図表サブセットを内包する。
- セキュリティtheme: テクノロジー
marimo 侵害、LLM 主導で内部 DB 流出
Sysdig は CVE-2026-39987 経由で marimo を侵害した攻撃者が、LLM エージェントを主役に 4 段ピボットを 1 時間で完走させ、内部 PostgreSQL を盗み出した事例を初公表した。
- AI / MLtheme: テクノロジー
Claude Opus 4.8 公開、コーディング性能と正直さ強化
Anthropic は Claude Opus 4.7 の後継となる Claude Opus 4.8 を公開。エージェントコーディングが 69.2% に向上し、自己進捗の正直さも改善。価格は据え置き。
- AI / MLtheme: テクノロジー
DeepSeek、V4-Pro の API 価格 75% 引き下げを恒久化
DeepSeek が 5 月 23 日、旗艦モデル V4-Pro の 75% 値下げを 5 月末で終了せず恒久化すると発表。API 単価は最大 4 分の 1 となり、AI の価格競争が新たな局面に入りました。
- AI / MLtheme: テクノロジー
Anthropic、Glasswing 初月で重大脆弱性 10,000+ 件を確認 — Mythos Preview のスキャン結果公開
Anthropic は 5 月 22 日、4 月発表の Project Glasswing の初期アップデートを公開し、Claude Mythos Preview と約 50 のパートナーが運用開始からおよそ 1 ヶ月で重大度 High / Critical の脆弱性 10,000 件超を発見したと明らかにした。OpenBSD で 27 年間見過ごされていたバグや FFmpeg の 16 年もののバグ、Firefox 150 で修正された 271 件などが具体例として挙げられている。
- AI / MLtheme: テクノロジー
Google、Gemini 3.5 ファミリー始動 — まず 3.5 Flash 公開、Pro 超え+4倍速で $1.5/$9 価格
Google は I/O 2026 で次世代モデル群 Gemini 3.5 を発表し、最初の出荷モデル『3.5 Flash』を即日公開した。前世代 3.1 Pro をコーディング・エージェント系ベンチで上回りつつ出力速度は 4 倍。3.5 Pro は来月投入予定。
- AI / MLtheme: テクノロジー
東芝、人事システム「Generalist」V8 を提供開始 — MCP 対応で LLM と業務データ連携
東芝デジタルソリューションズは統合人事給与システム Generalist/HR/PR の新バージョン V8 を 5 月 19 日に提供開始。Model Context Protocol (MCP) 対応で社内 LLM と業務データを安全に接続でき、自然言語で検索条件を提案する人財検索 AI 機能も搭載する。
- セキュリティtheme: テクノロジー
Ollama に重大 OOB read 脆弱性 CVE-2026-7482『Bleeding Llama』⇒ 約 30 万台のサーバにメモリ漏えいリスク
Cyera が 5 月初旬に公表したローカル LLM 実行基盤 Ollama の脆弱性 CVE-2026-7482『Bleeding Llama』が、5 月 10 日に The Hacker News などで本格的に報じられました。GGUF テンソル解析処理のヒープ OOB read で、未認証リモート攻撃者がプロセスメモリを丸ごと漏えいさせることが可能。インターネット公開中の約 30 万台が影響を受けると見られ、修正版は 0.17.1。
- AI / MLtheme: テクノロジー
OpenAI、ChatGPT 標準を「GPT-5.5 Instant」へ刷新 ⇒ 幻覚を 52.5% 削減
OpenAI は 5 月 5 日、ChatGPT の標準モデルを GPT-5.5 Instant に刷新したと発表。医療・法律・金融など高リスク領域の幻覚を GPT-5.3 比で 52.5% 削減し、過去会話・ファイル・Gmail を参照する強化パーソナライズと、絵文字を控えた簡潔な応答を打ち出しました。
- AI / MLtheme: テクノロジー
xAI、Grok 4.3 と『Custom Voices』を公開 1 分の音声でクローン作成
xAI が 5 月 2 日に Grok 4.3 を公開し、約 1 分の音声から 2 分以内にクローン音声を生成する『Custom Voices』機能を同時投入。28 言語・80 種以上のプリセット音声と同じ TTS / 音声エージェント API から呼び出せ、xAI コンソール上では追加課金なしで利用可能。
- AI / MLtheme: テクノロジー
Reddit、AI 検索の週間 8000 万人到達 Q1 売上は前年比 69% 増 6.63 億ドル
Reddit が 5 月 1 日に発表した 2026 年 Q1 決算で、検索の週間アクティブユーザーが 8000 万人 (前年比 +30%) に到達した。同社の AI 検索エンジン Reddit Answers の週間利用者は 1 年で 1500 万人へ拡大、売上は 6.63 億ドル (前年比 +69%)、広告売上 6.25 億ドル (同 +74%) と Wall Street 予想を上回った。
- Tech 政策theme: テクノロジー
中国・杭州中級法院、AI 置換目的の解雇は違法と判断 LLM 導入で減給拒否の社員勝訴
中国・浙江省の杭州中級人民法院が 4 月 30 日、コスト削減のみを目的に従業員を AI に置き換えて解雇することは違法とする判断を示したと報道された。LLM 導入で業務が自動化された QA 監督の Zhou 氏が大幅減給と配置転換を拒んで解雇された事案で、下級審の違法判決を維持。AI 導入だけでは労働契約終了の正当事由とならないと明確化した。
- AI / MLtheme: テクノロジー
主要 LLM は『日本文化』に偏る 欧州チームが 24 言語で検証、ITmedia が報道
スペインのバスク大学と英カーディフ大学の研究チームが、GPT-4o-mini など 8 つの主要 LLM が文化を語る際に日本に強く偏る傾向を実証した論文を公開した。24 言語 31,680 問のベンチマーク『CROQ』で検証したところ、事前学習段階では各国を均等に参照していたモデルが、人間向けの安全・有用化チューニング後に日本と米国へ集中する分布へ変化したという。ITmedia が 4 月 30 日に内容を報じた。
- AI / MLtheme: テクノロジー
NVIDIA、マルチモーダル MoE モデル Nemotron 3 Nano Omni を公開
NVIDIA が 4 月 28 日(米時間)、テキスト・画像・動画・音声を 1 つの推論ループで扱うオープンマルチモーダル基盤モデル Nemotron 3 Nano Omni を公開した。Mamba と Transformer を組み合わせた Hybrid MoE 構成により、総 30B パラメーターから推論時に 3B のみを活性化し、128 個のエキスパートから 6 個へ動的にルーティングする。重み・データ・学習レシピのいずれも開放し、Hugging Face と build.nvidia.com から直接利用できる。
- AI / MLtheme: テクノロジー
Mistral、128B モデル Medium 3.5 と Vibe Remote Agents 公開
Mistral AI は 4 月 29 日、フラグシップ密モデル Mistral Medium 3.5(128B、256k コンテキスト)と、クラウド上で長時間コーディングを並列実行する Vibe Remote Agents を公開した。SWE-Bench Verified 77.6% を記録し、改変済み MIT のオープンウェイトとして Hugging Face で配布する。
- セキュリティtheme: テクノロジー
LLM 推論基盤 LMDeploy に SSRF 脆弱性 ⇒ 公開 13 時間で実環境悪用
OpenMMLab の LLM 推論サーバ LMDeploy に Server-Side Request Forgery 脆弱性 CVE-2026-33626 が公開された。Sysdig のハニーポットには 13 時間以内に攻撃が到達。
- AI / MLtheme: テクノロジー
DeepSeek V4 Preview 公開 ⇒ 1M 文脈と MoE 両建てでフロンティアに肉薄
中国 DeepSeek が V4-Pro / V4-Flash をプレビュー公開。1M トークン文脈と MoE、MIT ライセンスでの Hugging Face 配布が特徴。
- AI / MLtheme: テクノロジー
OpenAI、GPT-5.5 を公開 ⇒ 1M 文脈とエージェント特化
OpenAI が 4 月 23 日に GPT-5.5 を公開。1M トークン文脈と複数ツール連携を活かしたエージェント用途に特化し、API 価格は GPT-5.4 比で倍の 5 / 30 ドルに設定された。
- セキュリティtheme: テクノロジー
Ollama の量子化エンジンに未認証メモリ漏洩、CVE-2026-5757 で公表
CERT/CC が Ollama の量子化エンジンにある未認証のリモート情報漏洩脆弱性 CVE-2026-5757 を公表。GGUF ヘッダの改竄でヒープメモリを読み出し、レジストリ API で外部に送出できる。
- ハードウェアtheme: テクノロジー
Google、第 8 世代 TPU を学習用と推論用に分割 ⇒ TPU 8t / 8i を発表
Google Cloud Next 2026 で発表された第 8 世代 TPU は、学習向けの TPU 8t と推論向けの TPU 8i の 2 SKU 構成。自社開発の Axion ARM CPU をホストに据え、Ironwood 比で大幅な性能向上を謳う。
- セキュリティtheme: テクノロジー
Cohere の Python サンドボックス Terrarium に CVSS 9.3 の脱出脆弱性
Cohere AI が公開する Python サンドボックス Terrarium に、ホスト上での root 権限コード実行を許す重大な脱出脆弱性 CVE-2026-5752 が報告された。
- AI / MLtheme: テクノロジー
OpenAI、画像生成「Images 2.0」を発表 多言語テキスト描画が大幅向上
OpenAI が ChatGPT の画像生成を刷新する「Images 2.0」を 4 月 21 日に公開。推論モード搭載で 2K 出力に対応し、日本語など非ラテン文字の描画精度が大幅に向上した。
- AI / MLtheme: テクノロジー
Anthropic、最強モデル「Claude Mythos」と Project Glasswing を発表
Anthropic が公開を見送る未公開フロンティアモデル Claude Mythos と、重要インフラ防御を狙う Project Glasswing を発表。50 組織に gated access を提供する。