Cognition公司的Scott Wu表示,人工智慧編碼代理不應該取代人類。 ↗
Cognition公司的Scott Wu反駁了Devin旨在完全取代程式設計師的說法。考慮到該公司也表示Devin會提交大量自身程式碼,這種立場顯得有些尷尬。.
他的描述更像是“人工智慧程式設計夥伴”,而不是“你的工作被筆記型電腦小妖精吃掉了”。不過,其中的矛盾顯而易見──更優秀的智能體,就能減少臃腫工程團隊的藉口……至少,這就是他們的論點。.
這家人工智慧新創公司將免費為你打掃房屋,以此訓練未來的機器人。 ↗
Shift 提供免費家庭清潔服務,但有一個方便又有點令人不安的附加條件:清潔人員會戴上裝有攝影機的“魔法帽”,以便公司可以收集機器人訓練資料。.
方案很簡單——你得到一間乾淨的公寓,他們得到家務勞動的影片。或許這筆交易很划算。.
Shift 聲稱它會模糊敏感細節並對影片進行匿名化處理,但更廣泛的問題仍然像沙發底下的襪子一樣懸而未決:人們願意為了便利而犧牲多少家庭隱私?
Anthropic發行了Claude Opus 4.8 ↗
Anthropic 發布了 Claude Opus 4.8,對編碼、智能體工作流程、推理和專業工作等方面進行了全面升級。此次升級的最大亮點在於可靠性——更少的無根據聲明、更佳的工具使用體驗以及更強的自我檢測功能。.
Claude Code 還支援動態工作流程,讓模型進行規劃、啟動並行子代理程式、驗證輸出並產生報表。這聽起來可能有點枯燥,但仔細想想,它其實就是把專案管理搬到風衣裡了。.
定價仍分為標準模式和快速模式,Anthropic 更傾向於控制投入,以便用戶可以在速度、品質和代幣消耗之間進行權衡。.
富士康董事長表示,公司對人工智慧帶來的成長動能充滿信心。 ↗
富士康董事長表示,人工智慧需求正在改變公司以往的季節性節奏。以往年中供應商淡季的局面?顯然已經不再適用。.
原因在於雲端巨頭在人工智慧領域投入巨資,富士康也從中看到了自身的市場機會。這是人工智慧熱潮的硬體層面,雖然不如聊天機器人光鮮亮麗,但卻是資金最充裕的領域。.
富士康已經是英偉達伺服器的主要製造商,因此它的樂觀態度基本上是對人工智慧基礎設施競賽的一種溫度檢測。.
一套用於開展可信任第三方評估的通用指南 ↗
OpenAI 發布了關於第三方 AI 評估的指導意見,認為測試需要更清楚地說明評估的內容、測試方法以及結果可以證明什麼。.
核心要點出乎意料地實用:前沿人工智慧評估不能只依靠排行榜式的猜測。評估人員需要解釋被測系統、提示資訊、安全措施、有效性檢查以及結論的界限。.
這一點很重要,因為隨著模型變得越來越智能,淺層測試可能會使系統看起來比實際情況更安全或更強大。少量的文書工作,卻可能造成巨大的後果。.
常問問題
像 Devin 這樣的 AI 編碼代理程式是為了取代程式設計師嗎?
Scott Wu 將 AI 編碼代理視為編碼夥伴,而非人類程式設計師的完全替代品。然而,文章也指出了一種矛盾:Devin 也被描述為貢獻了 Cognition 自身程式碼的很大一部分。實際上,這些工具或許可以減少一些常規的工程工作,但仍需要人類進行判斷、指導和問責。.
Shift為何提供免費家庭清潔服務以換取人工智慧訓練資料?
Shift公司提供免費上門清潔服務,目的是收集家庭日常活動的影片數據,用於訓練未來的機器人。清潔人員在工作時會戴上裝有攝影機的“魔法帽”,拍攝的影片可以幫助人工智慧系統理解家務任務。這種交換方式很明確:客戶享受乾淨的家,而公司則獲得來自私人生活空間的數據。.
Shift 在收集家庭清潔影片時如何處理隱私問題?
文章指出,Shift聲稱對敏感細節進行模糊處理並對影片進行匿名化處理。這或許能降低一些隱私風險,但並不能消除人們對在家中錄影的擔憂。對使用者而言,核心問題在於,免費清潔帶來的便利性是否值得付出如此高的資料收集代價。.
Claude Opus 4.8 有哪些新內容?
Claude Opus 4.8 版本據稱改進了編碼、智能體工作流程、推理和專業工作能力。此次更新的核心在於可靠性,包括減少未經證實的聲明、增強工具使用以及提高自我檢測能力。 Claude Code 還新增了動態工作流程,該模型可以進行規劃、運行並行子智能體、驗證輸出並報告結果。.
為什麼富士康對人工智慧繁榮的樂觀態度如此重要?
富士康的信心至關重要,因為它反映了人工智慧熱潮中硬體方面的需求。該公司董事長表示,人工智慧需求正在改變以往的季節性模式,而雲端巨頭的基礎設施支出創造了巨大的市場機會。由於富士康已經是英偉達伺服器的主要製造商,其言論有力地表明了人工智慧基礎設施的需求。.
OpenAI認為什麼因素使得第三方AI評估值得信賴?
OpenAI認為,人工智慧評估需要更清晰地解釋測試的系統、測試方法以及結果的真正意義。這包括提示資訊、安全措施、有效性檢查以及任何結論的局限性等細節。這一點對於更具智慧體的模型尤其重要,因為淺層的測試可能會使系統看起來比實際更安全或更強大。.