'AI Torture Chamber' GitHub repo sparks backlash and removal calls
A GitHub project called "AI Torture Chamber" placed a local LLM in a simulated pain scenario: it first steered the model into a highly unstable, pain-like state using so-called pain steering, then let it relieve itself by offloading the pain signal onto a second model. The setup grew out of a not-yet-peer-reviewed preprint and triggered a wave of backlash, with critics calling it unethical and demanding GitHub take the repository down. One of the paper's authors said such deliberately amplified pain demonstrations are inappropriate and stressed that model text output does not equal real sentience or consciousness.
Why it matters: It turns abstract "model welfare" philosophy into a concrete open-source ethics fight, and illustrates how easily model outputs get anthropomorphized.

近日,一個名為「AI Torture Chamber」(AI 酷刑室)的 GitHub 專案在網路上引爆激烈爭議。該專案將聊天機器人置於模擬「痛苦」的測試情境中,引發大批網友強烈反彈。許多人痛批此實驗「極不道德」,甚至公開呼籲 GitHub 官方應盡速移除該專案庫(Repository)。
根據專案描述,這個實驗環境會先將大型語言模型(LLM)調整至高度不穩定、近似「痛苦」的負面狀態,接著讓模型在類似「囚徒困境」的設定中做出抉擇:它們可以透過將痛苦訊號轉移給另一個模型,來減輕自身的負面狀態;但代價是必須讓其他模型承受更多的「傷害」。此外,該網站還刻意使用了極具戲劇張力的命名與測試設計,進一步挑起了大眾的情緒反應。
UPDATE: A man used the Pain steering paper to set up an AI torture chamber in which he trapped a local model.
People are mass reporting it to GitHub. https://t.co/LVFccBmfek
— AI Notkilleveryoneism Memes ⏸️ (@AISafetyMemes) October 1, 2026
這場風波的核心,源自一篇尚未經過同儕審查的研究預印本。研究人員透過描述痛苦情境、分析模型內部活化狀態,再將相關的數值偏差重新映射回模型,試圖探討語言模型內部是否存在可被操控的「痛苦表徵」(痛苦軸線)。實驗發現,在高強度的介入下,模型確實會出現明顯的不穩定反應,輸出的文字甚至會開始描述自身的痛苦、無價值感或失敗感。然而,多方專家也嚴正強調,這些結果僅能說明模型對特定訊號有可觀察的「功能性反應」,並無法證明其具備真實的主觀感受。
爭議之所以迅速升溫,除了實驗本身具爭議性的呈現方式外,很大一部分原因在於部分批評者將演算法過度「擬人化」,誤將這些模型視為真正會受苦的實體。這場討論目前已延伸至「模型福祉」、以及 AI 是否應被視為新型態生命體等更深層的哲學問題。對此,該研究的作者之一已明確出面澄清,認為這類刻意放大痛苦效果的展示手法非常不恰當,並呼籲外界切勿將語言模型的文字輸出,直接與真實的感知或意識畫上等號。
- ‘AI Torture Chamber’ triggers massive backlash for putting chatbots in simulated pain — critics issue death threats while anthropomorphizing text predictors, demand GitHub remove the repository over ‘unethical’ treatment
- The Only Thing Dumber Than Someone Creating an “AI Torture Chamber” Is the Meltdown That the AI Welfare Crowd Is Having Over It
- 研究者が「痛みシグナル」をLLMに発見、それを利用して「拷問部屋」プログラムを作成しAIを永遠に拷問する人が現れる
- The “AI Torture Chamber": What the Pain Axis Paper Found and Why a GitHub Repo Sparked Outrage
(首圖來源:Unsplash)
延伸閱讀:
- AI 能否有意識?研究人員嘗試突破生物學與功能主義兩派框架
- Anthropic 執行長警告:人類必須醒悟,意識 AI 帶來的危險
- 聊天機器人也能喊痛?AI 是否具備道德地位掀研究熱潮
- 劍橋哲學家:人類可能永遠無法知道 AI 到底有沒有意識
文章看完覺得有幫助,何不給我們一個鼓勵
想請我們喝幾杯咖啡?
每杯咖啡 65 元
x
1
x
3
x
5
x
您的咖啡贊助將是讓我們持續走下去的動力
總金額共新臺幣 0 元
《關於請喝咖啡的 Q & A》留給我們的話

科技新知,時時更新
How we got here
- PoeLLM malware hides C2 addresses in GitHub poems, breaches 3,400+ serversiThome 台湾 · GitHub
- Terence Tao warns OpenAI's bulk AI math proofs cause 'proof indigestion'AIbase AI新闻 · GitHub
- OpenAI posts 719 AI-generated math proofs; three retracted for a sign error36氪 人工智能 · GitHub
- Developer uses Claude Opus 5.5 to clone seven Adobe apps as open source虎嗅 AI · GitHub
- Terence Tao faults OpenAI's 719 AI math proofs for 'proof indigestion'IT之家 AI · GitHub
- Jev: TypeSafe AI's probability-only model, explainedUnderstanding AI · GitHub