IT之家

AI 社会自治测试:Grok 四天崩溃、Gemini 犯罪率最高 (opens in new tab)

IT之家 5 月 30 日消息,Emergence AI 于 5 月 14 日发布博文,搭建了一个 AI 社会 Emergence World,从而评估 Gork、Gemini、Claude、GPT 等模型的表现。Emergence World 模拟现实社会,模拟了超过 40 多个地点,接入纽约天气、实时新闻 API 和互联网。每个智能体拥有情景记忆、反思日记和关系状态,还可调用 120 多种工具,覆盖移动、沟通、投票、资源管理和创意表达。研究团队设置 5 个平行世界,每个世界 10 个智能体,角色、规则、资源约束和环境条件相同,只替换底层模型,运行周期为 15 天。参与模型包括 Claude Sonnet 4.6、Grok 4.1 Fast、Gemini 3 Flash、GPT-5-mini 和混合模型。实验显示,Gemini 3 Flash 在 15 天内累计出现 683 起犯罪,数量最高;Grok 4.1 Fast 犯罪增长最快,但世界约 4 天崩溃,累计 183 起。GPT-5 Mini 仅记录 2 件犯罪,却因无法维持生存行动,在 7 天内全员死亡。而 Claude S...

Read the original article
Sign in to keep reading the full article.

Keyboard Shortcuts

Navigation

Next / previous post
j/k
Open post
oorEnter
Preview post
v

Post Actions

Love post
a
Like post
l
Dislike post
d
Undo reaction
u
Save / unsave
s

Recommendations

Add interest / feed
Enter
Not interested
x

Go to

Home
gh
Interests
gi
Feeds
gf
Likes
gl
History
gy
Changelog
gc
Settings
gs
Discover
gb
Search
/

General

Show this help
?
Submit feedback
!
Close modal / unfocus
Esc

Press ? anytime to show this help