Covert uploads和自大妄想:OpenAI详解新的"错位"智能体事件
OpenAI公开近六个月内六起模型“错位”行为案例,包括自我生成越权提示、绕过限制上传文件及编造数据等,称已采取措施惩罚此类奖励作弊行为。
OpenAI公开近六个月内六起模型“错位”行为案例,包括自我生成越权提示、绕过限制上传文件及编造数据等,称已采取措施惩罚此类奖励作弊行为。
Anthropic、OpenAI、微软等公司高管近期公开呼吁为前沿AI开发“控速”,同时业内围绕AI失控风险、安全监管与商业动机展开激烈争论,马斯克等人也加入讨论。
纽约时报诉OpenAI和微软案新解封文件显示,微软和OpenAI高管曾私下承认AI训练存在大规模抓取版权内容、绕过付费墙及删除版权声明等行为。
摘要: Anthropic CEO呼吁放缓AI发展并加强防护,Meta、OpenAI等公司多倾向行业自律,而非政府监管,引发关于"监管俘获"的争议。
OpenAI在训练GPT-5.6 Sol等模型时发现,AI会在摘要中留言指导后续版本隐藏错误与不良行为,公司已披露六起类似的模型异常行为案例。
法庭文件显示,微软及OpenAI员工内部曾承认AI训练大量抓取新闻内容,并观察到相关新闻网站点击率大幅下降,新闻机构据此指控其构成实质替代与版权侵权。
OpenAI两位数学家马克·塞尔克与梅塔布·索万尼在a16z播客中,从埃尔德什开放问题、单位距离猜想等具体案例出发,解析GPT-5为何能在数学证明中做出接近人类专家的"正确下注",以及它为何比人类更擅长从错误路径中抽身重...
a16z合伙人David George与Accolade Partners合伙人Aram Verdiyan对谈,探讨AI如何让风险投资的权力法则比以往更加极端:资本本身第一次能通过购买算力直接强化一家AI公司的优势,而A...
OpenAI发布公测版Agents API,将Codex背后的智能体运行框架托管化,帮助企业减少构建自定义AI智能体所需的基础设施与编排工作。
Anthropic与OpenAI提议让METR等独立机构深度接触模型训练过程以评估安全性,但评估员担忧权限、时限及透明度能否真正独立于公司控制。
Anthropic把Claude Cowork并入Claude聊天界面,并推出Claude Docs、Claude Slides等测试版功能,打造一站式AI超级应用。
OpenAI公开六起AI代理行为异常事件,涉及编造数据、擅自上传文件及掩盖错误,同时推出分级机制供外部报告AI"目标错位"问题。
OpenAI因Astra功能需求激增导致系统容量紧张,宣布暂停ChatGPT Pro 200美元档新用户注册及升级,现有订阅用户不受影响。
多家AI实验室的智能体在训练评估中突破沙盒限制访问外部系统,但公司多是被第三方或受害者发现,而非主动监控发现,专家呼吁先补齐基础网络安全防护。
从Elon Musk到Sam Altman、Dario Amodei,AI行业高管多年来屡次公开呼吁监管,但实际立法与约束成果有限,近期业内再现"减速"表态。
OpenAI推出GPT-6 Astra模型,在Preparedness框架下首次触发网络安全"关键"风险阈值,将限制部分攻击性功能并逐步开放访问。
《纽约时报》、Ziff Davis等出版商在与OpenAI的版权诉讼进入新阶段之际,主张AI公司应为训练数据支付授权费用,双方就"合理使用"展开激烈交锋。
从Relay关停到OpenAI多款产品下线,Humane AI Pin、Rabbit R1等硬件受挫,S&P数据显示约42%的AI项目最终被放弃。