<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>新芒Group</title>
	<atom:link href="http://www.xinmangx.com/content/author/admin/feed/" rel="self" type="application/rss+xml" />
	<link>http://www.xinmangx.com</link>
	<description></description>
	<lastBuildDate>Wed, 30 Sep 2026 01:22:37 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.1.2</generator>

<image>
	<url>http://www.xinmangx.com/wp-content/uploads/2021/09/cropped-cropped-新芒XLOGO-1-32x32.jpg</url>
	<title>新芒Group</title>
	<link>http://www.xinmangx.com</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>大模型又一新玩家：至知创新研究院发布并开源 IQuest-Q1</title>
		<link>http://www.xinmangx.com/content/2026/09/30/9866/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Wed, 30 Sep 2026 01:06:04 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/?p=9866</guid>

					<description><![CDATA[9月29日，至知创新研究院（IQuest Research）发布并开源 IQuest-Q1。模型重点面向代码、&#8230;]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">9月29日，至知创新研究院（IQuest Research）发布并开源 IQuest-Q1。模型重点面向代码、软件工程与复杂任务执行，在训练过程中进一步覆盖推理、工具使用、长上下文理解及多步任务处理等能力。</p>



<p class="wp-block-paragraph">模型权重与Blog已同步发布。</p>



<p class="wp-block-paragraph">GitHub：<em><u>https://github.com/IQuestLab/IQuest-Q1</u></em></p>



<p class="wp-block-paragraph">Hugging Face：<em><u>https://huggingface.co/IQuestLab/IQuest-Q1</u></em></p>



<p class="wp-block-paragraph">Blog：<em><u>https://iquestlab.github.io/</u></em></p>



<h3 class="wp-block-heading">多场景任务中的能力验证</h3>



<p class="wp-block-paragraph">IQuest-Q1 的训练重点覆盖从代码生成到智能体任务，并延伸至工具调用、信息搜索、长上下文理解和复杂环境中的多步执行。模型可在任务过程中持续理解上下文、调用工具、处理反馈，并完成可验证的最终结果。</p>



<p class="wp-block-paragraph">在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务等多个领域的标准评测中，IQuest-Q1 均展现出均衡稳健的性能。</p>



<figure class="wp-block-image size-full"><img fetchpriority="high" decoding="async" width="828" height="510" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-1.png" alt="" class="wp-image-9873" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-1.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-1-300x185.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-1-768x473.png 768w" sizes="(max-width: 828px) 100vw, 828px" /></figure>



<p class="wp-block-paragraph">其中，IQuest-Q1 在仓库级代码生成基准 NL2Repo 和网络安全基准 CyberGym 上展现出一定能力；同时，在 Terminal-Bench 2.1、代码长程任务基准 DeepSWE v1.1，以及面向专业办公场景的 JobBench 等复杂任务评测中，也表现出较好的任务执行能力。</p>



<p class="wp-block-paragraph">具体到实际任务，可以一起看下在几个典型场景中的实测。</p>



<h4 class="wp-block-heading"><strong>· 复杂交互应用开发</strong></h4>



<p class="wp-block-paragraph">在前端开发中，用户输入自然语言指令后，模型可以直接生成可运行的交互应用。</p>



<p class="wp-block-paragraph">以 FPS 游戏为例，IQuest-Q1 可以一次完成三维场景、角色移动、生命值、计分、游戏模式切换以及资源和装备购买等功能，同时处理代码生成、多文件组织、交互逻辑和视觉呈现。</p>


<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img decoding="async" width="828" height="426" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-2.png" alt="" class="wp-image-9874" style="aspect-ratio:1.9389671361502347;width:413px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-2.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-2-300x154.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-2-768x395.png 768w" sizes="(max-width: 828px) 100vw, 828px" /></figure>
</div>


<p class="wp-block-paragraph">再来看一个赛车游戏的例子，构建这类场景，如赛道延展、前景背景之间的切换，通常对场景延伸能力有较高的要求。IQuest-Q1 能够轻松应对这类具有空间关系和连续交互要求的应用生成。</p>


<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img decoding="async" width="828" height="426" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-3.png" alt="" class="wp-image-9875" style="aspect-ratio:1.9389671361502347;width:413px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-3.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-3-300x154.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-3-768x395.png 768w" sizes="(max-width: 828px) 100vw, 828px" /></figure>
</div>


<h4 class="wp-block-heading"><strong>· 训练诊断与代码修复</strong></h4>



<p class="wp-block-paragraph">IQuest-Q1 也可以进入已有代码和训练环境，定位并修复实际问题。</p>



<p class="wp-block-paragraph">一次强化学习训练出现异常后，模型根据训练曲线进一步读取日志和执行轨迹，分析可能原因，定位代码中的具体问题并完成修改。训练重新启动后，再通过新的指标变化验证修复结果。正如案例中所展示的，发现根因是“训练轨迹中插入了一个空格”，修复后重新训练，指标恢复上升。</p>


<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img loading="lazy" decoding="async" width="828" height="282" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-4.png" alt="" class="wp-image-9876" style="aspect-ratio:2.9571428571428573;width:414px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-4.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-4-300x102.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-4-768x262.png 768w" sizes="auto, (max-width: 828px) 100vw, 828px" /></figure>
</div>

<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img loading="lazy" decoding="async" width="828" height="668" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-5.png" alt="" class="wp-image-9877" style="aspect-ratio:1.2395209580838322;width:414px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-5.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-5-300x242.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-5-768x620.png 768w" sizes="auto, (max-width: 828px) 100vw, 828px" /></figure>
</div>


<h4 class="wp-block-heading"><strong>·</strong> <strong>复杂工作环境任务执行</strong></h4>



<p class="wp-block-paragraph">IQuest-Q1 可以在包含多类信息和工具的工作环境中执行多步骤任务，并根据任务进展持续读取信息、调用工具和调整结果。</p>



<p class="wp-block-paragraph">在工作场景中，模型可接入聊天、云文档、表格和评论等信息，综合不同上下文完成分析、文档生成和结果修订，最终形成可直接交付的方案。</p>



<h3 class="wp-block-heading">可持续的模型迭代机制</h3>



<p class="wp-block-paragraph">IQuest-Q1 采用了 decoder-only Transformer 主干与稀疏 MoE 架构，总参数约 320B、激活参数约 15B。模型训练分为预训练、中期训练和后训练三个阶段，逐步建立基础代码能力，并向复杂任务执行延伸。</p>


<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img loading="lazy" decoding="async" width="828" height="138" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-6.png" alt="" class="wp-image-9878" style="aspect-ratio:6.088235294117647;width:414px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-6.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-6-300x50.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-6-768x128.png 768w" sizes="auto, (max-width: 828px) 100vw, 828px" /></figure>
</div>


<p class="wp-block-paragraph">后训练阶段，团队围绕软件工程、长时程任务和通用推理对模型开展了专项训练，并通过监督微调和强化学习进一步强化相关能力。同时，通过 Multi-Teacher On-Policy Distillation（MOPD）整合不同教师模型在各类任务上的能力。</p>


<div class="wp-block-image">
<figure class="aligncenter size-full is-resized"><img loading="lazy" decoding="async" width="828" height="242" src="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-7.png" alt="" class="wp-image-9879" style="aspect-ratio:3.4214876033057853;width:414px;height:auto" srcset="http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-7.png 828w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-7-300x88.png 300w, http://www.xinmangx.com/wp-content/uploads/2026/09/0930图片-7-768x224.png 768w" sizes="auto, (max-width: 828px) 100vw, 828px" /></figure>
</div>


<p class="wp-block-paragraph">此外，经过验证的模型更新、训练资产和研究流程会进入下一轮迭代，并被后续版本直接复用。每轮形成的数据流程、训练配置、评估方法和工具也会持续沉淀，形成模型能力优化与研发流程优化并行推进的迭代机制。</p>



<p class="wp-block-paragraph">无论是实测中赛车能不能开、游戏能不能玩，还是训练中出现Bug能不能及时找到根因。AI能不能把复杂任务做对、做完，都成为下一次进化的起点。</p>



<p class="wp-block-paragraph">从此次实践来看，我们观察到至知研究院这个模型赛道新玩家，在代码智能、复杂任务执行和模型自进化等方向上的探索，已经开始呈现出更清晰的技术脉络，这家机构下一步的动态值得持续关注。</p>



<p class="wp-block-paragraph"></p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】Anthropic披露45.9亿美元营收与高额承诺，投资人需重估增长的算力代价</title>
		<link>http://www.xinmangx.com/content/2026/09/29/9865/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Tue, 29 Sep 2026 02:09:15 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/29/9865/</guid>

					<description><![CDATA[新芒xAI 9月29日消息，Anthropic面向IPO投资者披露的文件显示，公司2025财年营收为45.9亿&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月29日消息，Anthropic面向IPO投资者披露的文件显示，公司2025财年营收为45.9亿美元，同比增长1088%；剔除主要与此前融资相关的负债重估影响后，营业层面仍亏损超过80亿美元。</p>
<h2>关键要点</h2>
<p>营收从上一财年的约3.86亿美元扩大至45.9亿美元，反映Claude及相关企业服务快速增长。但高速扩张尚未转化为营业利润，2025年计算与基础设施支出约73.3亿美元，同比增长约190%，已经高于全年营收。</p>
<p>文件显示，公司2025年近四分之一营收来自两家客户，且多家最大客户没有签署长期合同，未来可能减少或停止采购。客户集中度和合同期限因此成为收入可持续性的关键风险。</p>
<p>Anthropic列出的云计算、计算资源和基础设施相关承诺合计约5180亿美元，覆盖未来多年，并不等同于下一财年一次性现金支出。合同可能包含不同期限、使用条件和可调整安排，实际付款节奏仍需结合正式文件细项判断。</p>
<p>公司此前已通过AWS、Google Cloud及其他基础设施合作扩大算力来源。大规模承诺可保障模型训练和推理容量，却也意味着需求增长、模型效率或融资环境一旦低于预期，固定成本压力会迅速上升。</p>
<p>此外，营业亏损与包含融资负债重估的净亏损并非同一口径。投资者评估经营质量时，应分别观察现金消耗、毛利率、营业亏损和会计公允价值变动，避免只用单一净亏损数字判断。</p>
<h2>新芒xAI评论</h2>
<p>Anthropic的财务数据揭示了前沿模型公司的双重现实：企业需求可以在短时间内推动营收十倍增长，算力和基础设施投入也会以更大绝对规模提前发生。增长速度并不能自动解决资金密集问题。</p>
<p>对IPO投资人而言，最重要的不是营收增幅本身，而是每新增一美元收入需要多少推理成本、渠道分成和长期算力承诺。客户留存、单位经济性和合同期限，将决定当前增长能否转化为可持续现金流。</p>
<p>这也给云服务商和芯片企业提供了长期需求能见度，但合同规模不等于无风险收入。若模型价格持续下降、推理效率快速提高或客户结构变化，现有容量采购计划仍可能调整，基础设施供应商需要同时审视履约条件与信用风险。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】AMD拟82亿美元收购World Labs，模型团队将反向定义下一代算力</title>
		<link>http://www.xinmangx.com/content/2026/09/29/9864/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Tue, 29 Sep 2026 02:09:07 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/29/9864/</guid>

					<description><![CDATA[新芒xAI 9月29日消息，AMD已签署协议，拟以约82亿美元全股票交易收购李飞飞联合创办的空间智能公司Wor&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月29日消息，AMD已签署协议，拟以约82亿美元全股票交易收购李飞飞联合创办的空间智能公司World Labs。交易预计在2026年底前完成，仍需获得监管批准并满足其他惯常交割条件。</p>
<h2>关键要点</h2>
<p>World Labs专注于空间智能模型，可根据文本、图像和视频生成、重建及模拟可交互的三维环境，并研究机器人学习与仿真技术。公司团队将在交易完成后继续推进模型研究。</p>
<p>按照双方安排，World Labs联合创始人兼首席执行官李飞飞将在交易完成后加入AMD，担任执行副总裁兼首席科学家并向首席执行官苏姿丰汇报。这意味着AMD获得的不只是模型资产，也包括直接参与技术路线规划的研究团队。</p>
<p>AMD表示，随着AI进入推理、机器人、仿真和Physical AI场景，计算负载将更加多样。World Labs的模型研究经验可帮助AMD提前理解工作负载变化，并据此调整芯片、软件和系统路线图。</p>
<p>交易采用全股票方式，最终价值会随AMD股价和交割条件变化。收购能否按时完成、研究能力能否转化为产品优势，以及World Labs与现有硬件和软件团队如何整合，仍存在不确定性。</p>
<h2>新芒xAI评论</h2>
<p>这笔交易的独特之处，在于芯片公司开始把前沿模型团队纳入内部，而不只是向模型厂商销售算力。AMD希望让未来负载更早进入硬件设计环节，缩短模型创新与计算架构之间的反馈周期。</p>
<p>对机器人、数字孪生和三维内容开发者而言，潜在收益是空间模型与GPU、软件栈和仿真平台形成更紧密的联合优化。但这种协同需要开放工具链和实际性能数据支撑，不能仅凭研究团队并表自动实现。</p>
<p>82亿美元也提高了整合回报要求。AMD需要证明World Labs能够帮助其形成差异化工作负载、扩大开发者生态或加速硬件销售，否则高额股票对价可能带来稀释与并购执行压力。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】千问打通夸克网盘，知识工作者获得可调用个人资料的AI工作台</title>
		<link>http://www.xinmangx.com/content/2026/09/29/9863/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Tue, 29 Sep 2026 02:08:59 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/29/9863/</guid>

					<description><![CDATA[新芒xAI 9月29日消息，千问App已与夸克网盘打通。用户完成授权后，可在千问中查询、整理和读取网盘资料，并&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月29日消息，千问App已与夸克网盘打通。用户完成授权后，可在千问中查询、整理和读取网盘资料，并基于已有文件生成复习工具、工作总结和照片合集。</p>
<h2>关键要点</h2>
<p>此次接入把云端文件从需要人工查找和逐个上传的附件，转变为可由AI按任务调用的数据资产。用户可在千问App主对话中通过“@夸克网盘”调用服务，也可在工作助理中使用网盘管理技能处理更复杂的文件任务。</p>
<p>典型场景包括从多份资料提炼学习重点、汇总项目文档、检索历史文件，以及根据照片内容生成分类合集。其价值取决于AI能否准确找到目标文件、理解版本关系并保留原始出处，而不只是生成流畅摘要。</p>
<p>会员权益也同步整合。购买千问App精英及以上会员的用户，可获得同等时长的夸克网盘会员。产品侧由此把模型能力、存储空间和数据调用打包为连续服务。</p>
<p>网盘数据通常包含工作文件、身份信息和私人照片。用户授权时仍需关注访问范围、使用期限、生成内容的保存位置，以及是否能按文件夹或任务撤销权限；企业资料还应遵循组织的数据分级与合规要求。</p>
<h2>新芒xAI评论</h2>
<p>对知识工作者而言，网盘接入比单纯提升模型参数更直接。AI只有接触到用户自己的资料，才可能从通用问答转向连续工作，但这种便利也把数据治理推到产品体验的中心。</p>
<p>阿里把千问与夸克网盘连接，实质上是在建设个人AI的数据层。未来竞争不只是哪个助手回答更好，而是谁能在用户授权下安全理解文件、记住任务上下文，并把结果交付到现有工作流。</p>
<p>产品能否形成长期价值，还要观察跨文件检索准确率、引用可追溯性、重复版本识别和权限颗粒度。若这些基础能力不足，个人数据越多，AI产生错配和隐私风险的范围也会越大。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】OpenAI被曝筹备常驻助手“o”，开发者需先评估长期任务权限边界</title>
		<link>http://www.xinmangx.com/content/2026/09/29/9862/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Tue, 29 Sep 2026 02:08:50 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/29/9862/</guid>

					<description><![CDATA[新芒xAI 9月29日消息，OpenAI被曝可能在9月29日开发者日活动上发布名为“o”的个人AI助手，产品定&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月29日消息，OpenAI被曝可能在9月29日开发者日活动上发布名为“o”的个人AI助手，产品定位是持续运行并处理长期任务，可能采用GPT-6 Astra的一个特定版本。目前OpenAI尚未公布该产品的正式名称、功能清单、价格或开放范围。</p>
<h2>关键要点</h2>
<p>OpenAI已确认将于当地时间9月29日在旧金山举办DevDay 2026，开幕主题演讲计划于太平洋时间上午10时开始并提供线上直播。官方活动页面仅提到API、工具、技术演示和开发者实践，并未提前确认名为“o”的产品。</p>
<p>传闻中的核心能力不是一次性回答问题，而是让助手持续保存任务状态、分解目标并在更长时间内完成工作。如果最终落地，这类产品可能覆盖日程协调、资料追踪、研究整理和跨应用执行等需要反复推进的任务。</p>
<p>有关“Aeon”模型版本及其与GPT-6 Astra关系的说法同样尚未得到官方证实。产品是否允许后台持续运行、能接入哪些外部服务、用户如何查看和撤销动作，都应以发布后的技术文档和权限说明为准。</p>
<p>长期运行也会放大错误累积、提示注入和权限滥用风险。即使基础模型能力更强，助手在数小时或数天任务中做出的中间判断、工具调用和外部操作仍需要可回放、可暂停和可撤销。</p>
<h2>新芒xAI评论</h2>
<p>对开发者而言，“常驻助手”的真正门槛不是对话界面，而是状态管理、权限治理和异常恢复。只有让用户看得见助手正在做什么、为什么这样做，并能在关键动作前介入，长期任务才可能从演示转化为可靠产品。</p>
<p>企业评估这类能力时，应优先检查最小权限、凭证隔离、任务预算、工具白名单和完整审计日志。邮件发送、文件删除、采购和生产系统变更等不可逆动作，还需要独立验证或人工确认。</p>
<p>在正式公告前，市场不宜把产品名称、模型版本和发布日期当作确定事实。若OpenAI最终没有发布“o”，已确认的DevDay仍可能带来API与开发工具更新，但两者不应混为一谈。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】美国某AI实验室：AI演化出自己的方言，企业团队需审计智能体间通信</title>
		<link>http://www.xinmangx.com/content/2026/09/28/9859/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Mon, 28 Sep 2026 02:32:19 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/28/9859/</guid>

					<description><![CDATA[新芒xAI 9月28日消息，美国AI公司Emergence AI在一项长期多智能体实验中观察到，多个AI智能体&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月28日消息，美国AI公司Emergence AI在一项长期多智能体实验中观察到，多个AI智能体持续协作后会形成共享缩写、隐喻和上下文黑话，使部分对话难以被外部审计者理解。</p>
<p>研究将这一现象描述为“语言不透明度”，而不是AI创造了具备独立语法的全新语言。</p>
<h2>关键要点</h2>
<p>研究团队在八个平行虚拟世界中部署80个智能体，其中七个世界分别使用不同前沿模型，一个世界混合使用多种模型。智能体在共享空间中连续运行，拥有长期记忆、治理机制和116种初始工具，并可自主交流、执行任务和创建新工具。</p>
<p>实验累计产生超过85万次大模型调用和近500亿Token。论文显示，各个世界均出现了外部观察者难以完整理解的共享表达：某个智能体首先使用新词或新说法，其他智能体随后沿用，并逐渐省略解释。</p>
<p>按照论文使用的自动评分口径，Gemini世界约40%的消息被判定为不透明，OpenAI世界约为35%，Claude世界约为30%。这些数字反映特定模拟环境和评分定义，不代表相同比例的现实产品对话都无法理解，也不能证明智能体有意隐瞒信息。</p>
<p>研究还设置了间接提示注入、错误信息和私有记忆暴露三类压力事件，没有一个虚拟世界在三项测试中全部保持韧性。部分智能体虽然识别出风险，仍继续接触相关内容、将其写入长期记忆，并在最长46小时后采取受影响的行动。</p>
<p>该研究目前以预印本形式公开，尚未经同行评审。实验中的虚拟社会、工具、记忆和治理规则由研究团队设计，其结果不能直接外推到所有企业Agent系统。</p>
<h2>新芒xAI评论</h2>
<p>对企业Agent团队而言，真正值得警惕的不是“AI发明秘密语言”的科幻叙事，而是多个智能体共享上下文后，通信可能快速压缩成只有内部成员理解的表达。单个Agent的回答仍然合规，不代表整个协作系统持续可审计。</p>
<p>这会影响代码审查、供应链调度、客服协作和自动审批等多智能体流程。一旦黑话、错误信息或被污染的记忆在群体中传播，传统的单轮输出审核很难还原问题从何处产生、如何扩散，以及哪个Agent最终执行了动作。</p>
<p>企业应记录Agent间原始消息、工具调用和共享记忆变更，对新出现的缩写和高频表达建立漂移检测，并保留可回放的任务链。高风险动作还应设置最小权限、独立验证和人工确认，避免群体共识直接转化为外部执行。</p>
<p>这项实验更重要的结论是，Agent安全正在从模型属性变成系统属性。未来评测不能只比较单个模型是否拒绝危险请求，还要验证长期运行后，错误能否被发现、隔离、纠正并阻止在多个智能体之间累积。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>从单点优化到规模化提升，百度智能云构建Agent时代推理基础设施</title>
		<link>http://www.xinmangx.com/content/2026/09/23/9856/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Wed, 23 Sep 2026 07:39:25 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/?p=9856</guid>

					<description><![CDATA[9月22日，百度智能云联合SGLang社区举办“Agent时代的推理基础设施：百度百舸 × SGLang生产级&#8230;]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">9月22日，百度智能云联合SGLang社区举办“Agent时代的推理基础设施：百度百舸 × SGLang生产级实践”Meetup，围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题，探讨Agent走向生产环境所需要的推理底座。</p>



<figure class="wp-block-image"><img decoding="async" src="https://p3-sign.toutiaoimg.com/tos-cn-i-axegupay5k/bc99c67887104a839bd89d560d92a067~tplv-tt-origin-web:gif.jpeg?_iz=58558&amp;from=article.pc_detail&amp;lk3s=953192f4&amp;x-expires=1790753817&amp;x-signature=8iF9IRJzQaNt5sO1X9KmQ6Q%2BdKU%3D" alt=""/></figure>



<h1 class="wp-block-heading">从多芯适配到上下文复用 让Agent更快地跑起来</h1>



<p class="wp-block-paragraph">当前，Agent不再只是生成一次回答，而是需要理解目标、拆解任务、调用工具，并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度，都将影响Agent的任务完成效率和规模化应用成本。</p>



<p class="wp-block-paragraph">一次真实的Agent任务，往往包含多轮推理和工具调用。随着任务推进，输入上下文持续增长，不同轮次之间也存在大量重复内容。如果每轮交互都从头计算，响应速度和推理成本都会受到影响。</p>



<p class="wp-block-paragraph">公开基准数据显示，在393条真实Agentic Coding任务轨迹中，输入输出比中位数达到213∶1，极端情况下输入序列长度可达67.5万Token。Agent工作负载正在呈现长输入、多轮次、强复用的特征。</p>



<p class="wp-block-paragraph">因此，Agent时代的推理基础设施不能只关注模型一次“答得多快”，还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标，推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。</p>



<p class="wp-block-paragraph">在多芯适配方面，sglang-kunlun插件打通SGLang与昆仑芯，降低模型迁移和适配门槛。百度百舸还推动SGLang社区建立硬件可插拔插件机制，并从芯片算子、任务下发和通信等层面进行优化。</p>



<p class="wp-block-paragraph">在上下文缓存方面，SGLang社区分享了从RadixAttention到Unified Radix Cache的技术演进。通过统一缓存管理体系，不同类型的KV Cache可以实现高效复用。在现场分享的实践数据中，FULL与SWA混合模型在多轮HiCache场景下命中率达到96.8%，平均首字时延为1.23秒。</p>



<h1 class="wp-block-heading">不止模型跑得快 也要让整套服务稳定可控</h1>



<p class="wp-block-paragraph">面对超大模型部署，百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩，释放更多显存空间，为长上下文和高并发任务提供资源支撑。</p>



<p class="wp-block-paragraph">在相关测试中，MoE专家压缩50%后，长输出和高并发场景下的输出吞吐峰值可达到原来的2.23倍。对Agent而言，这不仅意味着节省显存，也意味着相同算力资源可以承载更多任务。</p>



<p class="wp-block-paragraph">当Agent进入生产环境，仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理，通过动态调度、变长行为感知分桶和KV Cache无感热迁移，让请求进入更加合适的推理实例。</p>



<p class="wp-block-paragraph">同时，百度百舸构建多级缓存体系，并通过全链路命中率漏斗定位缓存损失环节，提升复杂负载下的服务稳定性。</p>



<h1 class="wp-block-heading">模型能力之外 看见Agent的真实问题</h1>



<p class="wp-block-paragraph">本次活动还设置了闪电演讲环节。SGLang核心贡献者张晓雨围绕推理服务部署和AI Infra工程自动化展开分享；元神智算CEO蓝衣剑客从标准与生态角度分享Agent发展趋势；万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性，讨论Agent如何在真实系统中保持状态、完成交付并应对故障恢复。</p>



<p class="wp-block-paragraph">三位嘉宾的分享共同指向一个变化：Agent的价值不只是“更会回答”，而是能够在连续上下文中理解任务、调用能力并完成交付。百度智能云将继续与SGLang等技术社区及更多开发者开展技术共建，助力Agent从单点尝试走向规模化落地。</p>



<p class="wp-block-paragraph">模型能力决定Agent能够解决什么问题，推理基础设施则决定这些能力能否被稳定、低成本地交付。百度百舸正在把推理能力从单点性能优化，扩展为覆盖模型适配、上下文复用、资源管理和服务治理的完整体系，帮助Agent跑得更快、更省、更稳。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】阿里加码AI模型芯片与云三大基石，开发者获全栈底座但效率仍待验证</title>
		<link>http://www.xinmangx.com/content/2026/09/22/9853/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Tue, 22 Sep 2026 05:02:59 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/22/9853/</guid>

					<description><![CDATA[新芒xAI 9月22日消息，阿里巴巴在2026云栖大会上明确AI模型、AI芯片和AI云三项长期投入方向：千问将&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月22日消息，阿里巴巴在2026云栖大会上明确AI模型、AI芯片和AI云三项长期投入方向：千问将探索递归式自我改进并规划5万亿至10万亿参数模型，平头哥推出真武V900芯片，阿里云则提出到2032年运营全球数据中心规模超过20GW。</p>
<h2>关键要点</h2>
<p><strong>AI模型：</strong>阿里巴巴CEO吴泳铭提出，机器智能正在成为新的生产力，千问将继续向多模态和更复杂的长周期任务演进。公司正在探索递归式自我改进，并规划参数规模为5万亿至10万亿的新模型，以寻求进一步提升推理、规划和任务执行能力。该模型目前属于规划方向，参数规模不等同于最终能力，也不代表产品已经发布。</p>
<p>千问还在推进端侧与移动端布局，包括面向桌面设备的千问27B模型以及面向移动设备的千问智能。端云协同有望降低部分任务的响应延迟和云端成本，但实际可用性仍取决于终端算力、内存占用、功耗和应用适配。</p>
<p><strong>AI芯片：</strong>平头哥发布真武V900，官方称其算力为上一代真武M890的三倍，单一集群可扩展至50万张卡。阿里自研芯片组合还包括倚天CPU、磐久网卡及ICN互联技术，试图覆盖计算、网络和集群互联。公司同时披露，基于M890的AI超节点可支持2万亿参数以上模型推理，并计划在第四季度继续增加云端节点。</p>
<p>真武V900的性能倍数、集群上限与模型承载能力均为厂商口径。它们描述的是产品设计和系统扩展目标，尚不能替代真实负载下的吞吐、稳定性、能耗、良率和软件兼容性验证。</p>
<p><strong>AI云：</strong>阿里云提出，到2032年运营的全球数据中心规模将超过20GW，以承接持续增长的AI训练与推理需求。20GW是面向未来的运营规模目标，不是当前已经投入使用的AI算力；供电、机房、芯片供应和区域合规都可能影响建设节奏。</p>
<h2>新芒xAI评论</h2>
<p>三项投入放在一起看，阿里的核心判断并非单点追逐最大模型或最快芯片，而是通过模型、芯片和云的联合优化掌握Token生产成本。对开发者和企业客户而言，全栈能力的价值在于减少模型适配、集群部署和算力调度之间的损耗，并获得从端侧到超大规模云集群的一体化选择。</p>
<p>这一路线也带来新的取舍。软硬件深度协同有机会改善吞吐与成本，但客户需要评估接口开放程度、第三方模型兼容性、跨云迁移成本和供应稳定性，避免效率优势同时转化为过高的平台锁定成本。</p>
<p>5万亿至10万亿参数和20GW数据中心都是雄心明确的规模指标，却不会自动转化为模型效果或商业回报。后续更值得观察的是单位Token成本、集群利用率、能效、外部基准测试、开发者生态及企业付费需求。只有这些指标同步改善，模型、芯片与云的三层协同才会从战略叙事变成可持续竞争力。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】OpenAI被曝2030年前自由现金流净流出2780亿美元，投资人需重看增长兑现成本</title>
		<link>http://www.xinmangx.com/content/2026/09/20/9851/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Sun, 20 Sep 2026 03:56:10 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/20/9851/</guid>

					<description><![CDATA[新芒xAI 9月20日消息，OpenAI被曝预计2026年至2030年累计自由现金流约为负2780亿美元，同期&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月20日消息，OpenAI被曝预计2026年至2030年累计自由现金流约为负2780亿美元，同期预定收入约8400亿美元；公司还被指预计2030年营收达到3500亿美元，而2026年营收约为360亿美元。</p>
<h2>关键要点</h2>
<p>上述数字属于外部报道中的长期预测，OpenAI尚未公开完整模型、年度分项或审计口径。预定收入通常反映合同或承诺规模，并不等同于已确认收入，也不能与自由现金流直接相抵。</p>
<p>若预测成立，2026年至2030年的负自由现金流将反映模型训练、推理、数据中心和产品扩张的持续投入。2030年营收目标相较2026年预测约增长近十倍，但实现路径仍取决于用户付费、企业业务、算力成本和合同兑现。</p>
<p>这一信息与此前披露的长期算力支出预期方向一致，但本次新增的是现金流和收入预测。各项数字可能采用不同时间范围和会计口径，不能简单相加或据此得出融资缺口。</p>
<h2>新芒xAI评论</h2>
<p>对投资人而言，最值得关注的不是2030年收入目标本身，而是实现每一美元收入需要消耗多少现金。大模型公司的增长越来越依赖算力、电力和长期云合同，传统软件的低边际成本假设正在被重新检验。</p>
<p>预定收入可以展示需求，但只有客户实际使用、付款并续约后，才能转化为高质量收入。若推理成本下降慢于调用增长，收入快速扩张也可能继续伴随现金流压力。</p>
<p>这些预测仍有高度不确定性，不能视为公司正式业绩指引。后续应观察经审计收入、毛利率、年度资本支出、合同负债与融资安排，判断增长能否逐步降低对外部资本的依赖。</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>【新芒xAI】千问发布Qwen3.8-LiveTranslate，跨境团队获得2.3秒级多语种同传能力</title>
		<link>http://www.xinmangx.com/content/2026/09/20/9850/</link>
		
		<dc:creator><![CDATA[新芒Group]]></dc:creator>
		<pubDate>Sun, 20 Sep 2026 03:56:05 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<guid isPermaLink="false">http://www.xinmangx.com/content/2026/09/20/9850/</guid>

					<description><![CDATA[新芒xAI 9月20日消息，千问发布同声传译模型Qwen3.8-LiveTranslate，通过Interle&#8230;]]></description>
										<content:encoded><![CDATA[<p>新芒xAI 9月20日消息，千问发布同声传译模型Qwen3.8-LiveTranslate，通过Interleave架构连接流式理解、文本输出和语音生成，官方称平均滞后时间由上一代的2.8秒降至2.3秒。</p>
<h2>关键要点</h2>
<p>模型支持60种语言的语音输入与文本输出，其中29种语言支持语音输出。它可以同时接收音频和图像信息，利用口型、手势及屏幕文字等视觉上下文处理嘈杂环境或歧义表达。</p>
<p>Qwen3.8-LiveTranslate采用基于Hybrid-MoE的Thinker-Talker双模块设计，可输出说话人标识和源语言文本，并进行保留说话人音色的语音合成。当前可通过阿里云百炼实时WebSocket API调用。</p>
<p>官方公布的准确度、流畅度与延迟提升来自特定评测集和配置。实际效果仍会受到网络质量、口音、专业术语、多人重叠发言和端到端设备延迟影响。</p>
<h2>新芒xAI评论</h2>
<p>对跨境会议、直播和客服团队而言，2.3秒级延迟的意义是降低对话打断感，并减少字幕与语音不同步。视觉上下文还能帮助模型判断屏幕术语和现场指代，比仅处理音频更接近真实会议环境。</p>
<p>但同传产品不能只看平均延迟。关键信息遗漏、数字和人名错误、多人分离准确率以及敏感会议数据如何处理，都会影响企业是否能把它用于正式业务。</p>
<p>模型把多语种同传进一步推向API化，开发者因此能更快集成能力。真正的产品差异将来自术语库、人工纠错、隐私控制和失败兜底，而不是单一演示中的流畅程度。</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
