サイモン・ウィリソン氏は、サンフランシスコで開かれたAI Engineer World’s Fairの招待基調講演で、LLM分野の進展はあまりに速く、わずか1年間でさえすっきり網羅するには長すぎると論じた。「The last six months in LLMs, illustrated by pelicans on bicycles(自転車に乗るペリカンで図解するLLMのこの半年)」と題されたこの講演は、同氏にとって同イベントへの3回目の登壇だった。当初は1年間を振り返る内容を提案していたが、リリースの速さにより、対象期間をその半分に絞らざるを得なかったという。

ウィリソン氏が話の枠組みとして用いた仕掛けは、意図的に奇妙なものだった。同氏はモデルに、自転車に乗るペリカンのSVGを生成するよう求めてきた。遊び心がありながら、多くのことが分かるベンチマークだ。同氏の主張は、テキストモデルは本来何も描けないはずなのに、コードは生成でき、SVGはコードだというものだ。このテストを使い、モデルが構造を維持し、指示に従い、実用に足るほど目標の形に近い出力を生成できるかを確認している。生成されたSVG内のコメントからは、モデルの推論の一端もうかがえる。

講演では続いて、相次いだリリースを駆け足で振り返った。ウィリソン氏は、AmazonのNovaモデル、MetaのLlama 3.3 70B、DeepSeekのv3とR1、Mistral Small 3を取り上げた。特に小規模なシステムがはるかに大規模なものの性能に近づき始めたことで、この分野の進展の速さから、ローカルモデルが再び注目に値するようになったという。同氏によれば、DeepSeekのR1は異例なほど幅広い注目を集め、Mistral Small 3は、24Bモデルがリソースを根こそぎ消費することなくノートパソコン上で実用になり得ることを示した。

同氏はまた、2月と3月に期待が再び変化したと論じた。Claude 3.7 Sonnetは多くのユーザーのお気に入りとなり、推論機能を追加したAnthropic初のモデルとなった。対照的に、OpenAIのGPT-4.5は高額で期待外れだと評され、o1-proはさらに高額だった。GoogleのGemini 2.5 Proも、新たな有力候補として登場した。ウィリソン氏の説明では、この一連の動きにより、モデルの品質、価格、ローカルでの使いやすさが、すべて同時に異なる方向へ動いていることが示された。

基調講演では、OpenAIがGPT-4o向けに公開した画像生成機能にも再び触れた。ウィリソン氏によると、これは1週間で1億件の新規アカウントを呼び込み、爆発的な拡散を引き起こした。同氏はこの機会を利用し、メモリとコンテキストの制御について、より慎重な論点を提示した。パワーユーザーとして、プロンプトに何が正確に含まれ、過去の会話の何をモデルが参照できるのかを知りたいという。同氏の全体的なメッセージは、どれか一つのモデルが勝利したというものではなかった。エコシステムがあまりに高速で、多様かつ実用的になったため、従来のベンチマーク習慣だけでは捉えきれなくなった、というものだった。

この基調講演が示したより大きな要点は、ベンチマークだけではもはや市場を定義できないということだ。ウィリソン氏は、コスト、ローカル実行、レイテンシー、開発者にとっての使い勝手を、付随的な論点ではなく最優先の問題として扱った。それが重要なのは、現在では仕事に最適なモデルが、単にランキング表の首位に立つものではなく、そのワークフローに適合するものである場合が多いからだ。同氏がこの半年を有用な分析単位としたのは、この分野の変化があまりに速く、より長い期間を対象とする概括では妥当性を保てないためだった。