AI分野でarXivに投稿された直近1週間の論文から7本をピックアップし、それぞれ概要・背景・手法・結果を整理しました。学会名の記載が無い論文も多く、その場合は「arXivプレプリント(査読前)」と表示しています。
Looped World Models
Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu, Hao Yang, Ronglai Zuo, Tongda Xu, Yonghao Li, Jian Chen, Hebin Wang, Zeyu Gao, Yang Li, Wei Zhao, Qimin Zhong, Siqi Liu, Yumeng Zhang, Leyan Cui, Zhangyu Wang, Wai Lam (2026). Looped World Models. arXiv:2606.18208.

一言概要: パラメータを共有するループ構造により潜在状態を反復的に洗練し、モデルサイズに依存しない新たなスケーリング軸を確立する世界モデルLoopWMを提案する。
背景・目的: 現在の世界モデルは、長期シミュレーションの忠実性には深い計算が必要だが、モデルを深くすると展開コストが増し誤差が累積しやすいというジレンマを抱えていた。モデルサイズやデータ量の拡大とは別の解決策が求められていた。
提案手法: パラメータ共有のTransformerブロックを用いて潜在環境状態を反復的に洗練するループ型アーキテクチャLoopWMを提案し、各予測ステップの複雑さに応じて計算の深さを自動調整する適応的計算を実現した。
結果: 従来手法に対し最大100倍のパラメータ効率を達成し、モデルサイズやデータ量の拡大とは独立した「反復的な潜在深度」という新たなスケーリング軸を確立した。コミュニティ全体を前進させうる方向性として位置づけている。
Orca: The World is in Your Mind
Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang (2026). Orca: The World is in Your Mind. arXiv:2606.30534.

一言概要: 無意識学習と意識的学習という2様式を組み合わせ、マルチモーダルな世界信号から統一的な世界潜在空間を学習する世界基盤モデルOrcaを提案する。
背景・目的: 従来はトークン・フレーム・行動それぞれの「次」を予測する孤立したタスクとして最適化されがちだったが、世界を理解・予測・行動する統一的な経路が求められていた。単一の世界潜在表現から複数の下流タスクを支えられるかが焦点となった。
提案手法: 連続動画から密な自然な状態遷移を学ぶ「無意識学習」と、言語で記述されたイベントやVQA教師信号からまばらな意味のある状態遷移を学ぶ「意識的学習」という2つの学習様式を組み合わせ、12.5万時間の動画データと1.6億件のイベント注釈で事前学習した。
結果: バックボーンを凍結し軽量なモダリティ別デコーダのみを学習する形でテキスト生成・画像予測・身体性行動生成という3つの下流タスクを評価し、同規模の専用ベースラインを上回る性能を確認した。より強い世界潜在表現がより強い下流性能につながることも検証している。
Agents' Last Exam
Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song (2026). Agents' Last Exam. arXiv:2606.05405.

一言概要: 250以上の業界専門家と協力して構築した、経済的価値のある実務タスクでAIエージェントを評価するベンチマークAgents' Last Examを提案する。
背景・目的: AIエージェントは多くのベンチマークで高い性能を示しているが、それが実際の専門的業務での経済的に意味のある活用には結びついていない。この乖離は、実務的で経済価値のあるワークフローでの持続的な性能測定を欠いた評価方法自体の問題だと論じている。
提案手法: 米国の職業分類O*NET/SOC 2018を参照し、13の産業クラスター・55のサブ分野・1000以上のタスクからなる非物理産業向けのタスク分類体系を構築した。検証可能な結果を持つ長期的で実務価値の高いタスクでエージェントを評価するベンチマークとして設計されている。
結果: 主要なハーネス・バックボーンの組み合わせ全体で、最難関ティアの平均完全達成率はわずか2.6%にとどまり、依然として飽和にはほど遠いことが示された。タスクプールは継続的に拡張される「生きたベンチマーク」として設計されている。
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng (2026). Program-as-Weights: A Programming Paradigm for Fuzzy Functions. arXiv:2607.02512.

一言概要: 自然言語仕様からローカル実行可能な軽量ニューラルアーティファクトを生成する新プログラミング手法Program-as-Weights(PAW)を提案する。
背景・目的: ログ行の重要度判定や壊れたJSONの修復、検索結果の意図別ランキングなど、明確なルールで実装しづらい日常的なプログラミングタスクは大規模言語モデルAPIに頼りがちで、局所実行性・再現性・コストの面で課題があった。
提案手法: 自然言語仕様からコンパクトでローカル実行可能なニューラルアーティファクトを生成する「ファジー関数プログラミング」というパラダイムを提案した。1000万件のデータセットFuzzyBenchで学習した4Bのコンパイラが、軽量な固定インタプリタ向けのパラメータ効率的なアダプタを出力する。
結果: 0.6BのQwen3インタプリタがPAWプログラムを実行することで、Qwen3-32Bへの直接プロンプトと同等の性能を、推論メモリ約50分の1、MacBook M3上で秒間30トークンという効率で達成した。関数定義ごとに1度コンパイルすれば以降は安価に再利用できる。
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo (2026). ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU. arXiv:2607.19191.

一言概要: AAAゲームやシミュレーション、動画にまたがる多様なデータで学習した、単一のデスクトップGPUでリアルタイム動作する行動条件付き世界モデルABot-World-0を提案する。
背景・目的: リアルタイムかつ長時間の閉ループ相互作用が可能な行動条件付き動画世界モデルの実現には、AAAゲームやシミュレーションエンジン、インターネット動画にまたがる多様なデータ基盤と、それを制御可能な世界の力学として学習する仕組みが必要だった。
提案手法: 学習フィードバックに基づきエージェントが自律的にデータ収集するWorldExplorerと、14種の決定的品質チェック・VLMによる評価・同期した行動/テキスト注釈からなる統一パイプラインを構築した。双方向教師モデルを因果的な生徒モデルへ段階的に蒸留し、LongForcingにより長時間の自己ロールアウトを拡張教師に整合させている。
結果: 低ビット構成の最適化により、単一のNVIDIA RTX 5090デスクトップGPU上で720P動画を最大16FPSでストリーミングでき、行動から最初のフレームまでの遅延1.2秒、ピークVRAM約19GiBを達成した。拡張的なインタラクティブロールアウトでも競争力のある制御性と一貫した長時間の世界進化を示した。
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho (2026). AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis. arXiv:2607.28618.

一言概要: 論文単位ではなく検証可能な「主張」単位で化学文献を横断検索できる新しいインフラAskChemを提案し、実際にWebで公開している。
背景・目的: 化学文献の統合には多数の論文に散在する知見を組み合わせる作業が必要だが、既存の文献検索システムはランク付けされた文献リストを返すだけで、研究者やAIエージェントは関連情報の特定・出典確認・複数論文にまたがる回答の組み立てを手作業で行う必要があった。
提案手法: 検索の単位を論文から出典DOIと引用箇所に裏付けられた原子的な「主張」へと変え、階層的な分類体系・主張同士を関係でつなぐエビデンスグラフ・科学的原理のもとに論文を位置づける探索的な分類体系という補完的な構造を提供している。
結果: 14.7万本の論文から240万件の主張を索引化しWebインターフェースとREST/SDK/MCPアクセスを提供した。AskChem-BenchにおいてGPT-5.5リーダーの根拠付けにAskChemを用いることで解決可能なDOI率100%(検索無しでは88.3%)を達成し、比較した5システム中で最も高い引用密度を示した。
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi (2026). Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents. arXiv:2607.28227.

一言概要: モバイル・PC・Web・DeepSearch環境を横断し、実機での長期タスク遂行を目指す実世界志向の基盤GUIエージェントQwen-UI-Agentを提案する。
背景・目的: GUIエージェントは既存のデジタル機器を操作する汎用実行主体になりうるが、実世界での活用には実機上での確実な動作、プラットフォーム横断のワークフロー実行、長期タスクの完遂、能動的なサービス開始、最小限の人手での自律的な能力向上が求められる。
提案手法: 多様なサンドボックス環境と大規模な実機モバイルランタイムを組み合わせ、GUI操作とCLI実行を織り交ぜた統一行動空間で1ターンにまとめて行動を生成する。AutoResearch方式のデータフライホイールとオンラインRLにより100ターン超・1万以上の並列環境での学習を実現している。
結果: モバイル利用ベンチマークで最高水準の性能を達成し(MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%)、PC・ブラウザ利用でもOpus 4.8やGemini 3.1 Pro、GPT-5.6 Solといった最先端モデルと競合する性能を示した(OSWorld-Verified 79.5%、WebArena 73.6%、ScreenSpot-Pro 81.5%)。
コメント(0)
まだコメントはありません。