关注我们: 微信公众号

扫码关注我们

DoorDash 试用 Kimi,美国国会出手调查

云头条 2026-08-02 21

2026 年 8 月 2 日,美国众议院两个委员会正在调查外卖平台 DoorDash 对月之暗面 Kimi K2.6 模型的测试和评估情况,要求其披露使用中国企业开发 AI 模型的具体用途及安全审查措施。

4.png

此次调查由美国众议院“美中战略竞争特别委员会”主席约翰·穆勒纳尔和众议院国土安全委员会主席安德鲁·加尔巴里诺发起。两人于 7 月 31 日致函 DoorDash 联合创始人兼首席执行官徐迅,要求其在 8 月 14 日前提交相关资料。

5.png

两名议员要求 DoorDash 列出其正在使用或曾经评估的中国开发 AI 模型,并说明这些模型的具体用途,以及是否接受过网络安全和其他风险测试。

负责 DoorDash AI 基础设施、软件安全、模型评估、采购以及法律合规工作的人员,还被要求在 8 月 21 日前参加闭门简报。

此次调查源于 DoorDash 此前公布的一项 AI 代码审查测试。

DoorDash 使用多种 AI 模型组合,检查程序员提交的代码修改。其中一种方案由 Kimi K2.6 负责第一轮扫描,再由 Anthropic 的 Claude Fable 5 对发现的问题进行复核。

6.jpg

横轴为问题召回率,纵轴为准确率。Kimi K2.6 与 Claude Fable 5 的组合召回率最高,同时保持约 89% 的准确率。

在 105 个有效代码审查案例中,Kimi K2.6 与 Claude Fable 5 的组合共识别出 537 个真实代码问题。加权召回率达到 65.2%,加权 F1 值为 75.3%,两项指标均位居参与测试的模型组合首位。

7.jpg

Kimi K2.6 与 Claude Fable 5 的组合,加权 F1 值达到 75.3%,平均审查一次代码合并请求的成本约为 3.81 美元。

8.png

DoorDash 当时正式使用的代码审查系统由 Claude Sonnet 4.6 和 Claude Opus 4.8 组成,共发现 504 项真实问题,加权召回率为 53.6%,加权 F1 值为 66.3%,平均每次审查成本约为 3.91 美元。

测试结果显示,Kimi K2.6 与 Claude Fable 5 的组合在发现更多潜在问题方面表现更好。

两名议员在调查函中承认,中国企业开发的开放权重模型可能具有性能较强、成本较低、便于定制等优势。不过,两人同时认为,美国企业采用此类模型仍需要建立相应的风险防护措施,并评估可能涉及的国家安全问题。

DoorDash 回应称,将与相关委员会沟通其如何安全、负责任地使用 AI,包括美国企业开发的前沿模型和开放权重模型。

 相关阅读 ·


美国盯上中国开源 AI 模型:Airbnb、Cursor 被调查

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

关键词:

网友留言2

未查询到任何数据!
◎欢迎您留言咨询,请在这里提交您想咨询的内容。