LargitData - 大數軟體

LargitData - 大數軟體 大數軟體有限公司 (LargitData Inc) 是一家提供人工智慧(AI)、輿情大數據(Big Data)在雲平台(Cloud)的AI 與大數據分析公司,主要產品包含:RAGi 企業級AI 決策平台、AIMochi - 會議智慧助理與 InfomIner即時輿情分析分析平台。

大數軟體有限公司 (簡稱LargitData) 是一家以資料為服務(Data As A Service)的公司,公司著眼於在巨量資料的商機,希冀能成為提供客戶快速、精準的資料分析服務的先驅.公司創辦人具有巨量資料分析的相關經歷,綜合過去的經驗與分析對市場未來的走向,致力打造以資料服務為核心的品牌。

公司相關報導: https://money.udn.com/money/story/8889/2321156

連模型評分都可以不靠真人,完全自動化?!過去 Arena AI 的評測是靠真實使用者兩兩比較後投票,累積出排名。好處是貼近真實使用情境,缺點是票要慢慢累積,新模型上線往往得等好幾天才有意義的分數。AutoEval 的作法是訓練一個獎勵模型,...
31/07/2026

連模型評分都可以不靠真人,完全自動化?!

過去 Arena AI 的評測是靠真實使用者兩兩比較後投票,累積出排名。好處是貼近真實使用情境,缺點是票要慢慢累積,新模型上線往往得等好幾天才有意義的分數。

AutoEval 的作法是訓練一個獎勵模型,讓它學會人類的偏好,再由它代替真人投票,一小時內就能產出排名。另一個好處是彈性,出題的 prompt 由 Arena 自己控制,可以快速針對特定領域評測。

這個獎勵模型是用 Arena 自家數百萬組人類兩兩比較的資料訓練出來的,讓它的打分排序跟人類判斷對得起來。

Arena 宣稱他們的文字獎勵模型在預測人類偏好上,比先進模型當裁判還準八到十個百分點。因為 Arena 上的題目本身就難,參賽的又都是強模型,常常沒有哪一邊全面壓倒性地好,這時候 LLM 裁判就卡住了,而用真實偏好資料訓出來的獎勵模型還抓得住人類到底偏好什麼。

不過使用者覺得什麼叫好回應,會隨著期待和使用情境一直變。訓練上要同時吃歷史資料維持穩定,又要跟上近期的趨勢,這不是訓練一次就結束的事。

目前 AutoEval 已涵蓋文字、視覺、圖像生成和程式碼。榜上會標示哪些分數來自 AutoEval,等真人票夠了再更新成正式分數。

只改兩個 API 設定,分數就成長三倍,輸出 token 還只剩六分之一?!OpenAI 發現 GPT-5.6 Sol 雖然能解數學難題,也打通了 Pokémon FireRed,但在 ARC-AGI-3 這個 2D 益智遊戲評測上的分數卻...
30/07/2026

只改兩個 API 設定,分數就成長三倍,輸出 token 還只剩六分之一?!

OpenAI 發現 GPT-5.6 Sol 雖然能解數學難題,也打通了 Pokémon FireRed,但在 ARC-AGI-3 這個 2D 益智遊戲評測上的分數卻低得離譜,GPT-5.5 更慘,幾乎完全玩不動。

他們發現問題出在 harness,ARC 的官方 harness 沒給工具也沒給特殊功能,想法是這樣才看得出模型的真本事。但這造成兩個問題:

1. 模型每做完一個動作,推理過程就被丟掉,等於每一步都要重新看懂遊戲一次,過去的計畫跟想法通通不見

2. harness 用滾動視窗處理長度限制,歷史一長,舊動作就忘記了

OpenAI 於是改用自家的 Responses API 重寫 harness,只開兩個設定:保留推理,以及用 compaction 取代滾動視窗。結果分數從 13.3% 跳到 38.3%,輸出 token 還只剩六分之一。人類受測者的平均大約是 48%,等於一口氣拉近了大半距離。原理也很直覺,模型記得自己剛剛在想什麼,就不用每一步從零推理,策略也才連貫得起來。

於是他們建議以後開發的時候用 Responses API、保留 reasoning、開 compaction,就能提升模型表現摟。

OpenAI 把 Codex Security 開源了!專案能用 AI 掃出程式碼裡的漏洞,還會進一步驗證漏洞是不是真的可以被利用,最後直接給你修補建議。現在 OpenAI 把它拆成獨立專案,以 Apache-2.0 開源釋出。插件版適合在...
29/07/2026

OpenAI 把 Codex Security 開源了!

專案能用 AI 掃出程式碼裡的漏洞,還會進一步驗證漏洞是不是真的可以被利用,最後直接給你修補建議。

現在 OpenAI 把它拆成獨立專案,以 Apache-2.0 開源釋出。插件版適合在自己專案裡隨手掃描,獨立版則是給資安團隊用的,可以一口氣掃完整個倉庫,還帶有歷史紀錄、結果去重跟誤報追蹤,也能直接接進 CI。

專案預設用 gpt-5.6-sol 掃描,分成排序、逐檔審查、驗證、攻擊路徑四個階段,結果可以匯出成 SARIF、CSV 或 JSON。另外還有個 install-hook,會在你每次 commit 前先掃過改動,抓到高風險就直接把提交擋下來。

成績方面,beta 三十天內掃了超過 120 萬次提交,挖出 792 個嚴重和 10561 個高風險漏洞,連 OpenSSH、GnuTLS、PHP、Chromium 等老牌專案都中招。也有第三方拿四個專案測試、約 16.2 萬行程式碼做對照,它的漏洞正確判斷率 74%,高於Snyk 的 28%與Semgrep 的20%。

這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache 裡,像一本愈翻愈厚的筆記本。內容愈長,要搬的資料愈多,最後卡...
28/07/2026

這篇文把 GPT-2 到 Kimi K3,到底改變了什麼,徹底解析了一番!

GPT-2 用的是 softmax 注意力,為了知道哪個字重要,它把讀過的每個字都留在 KV cache 裡,像一本愈翻愈厚的筆記本。內容愈長,要搬的資料愈多,最後卡在記憶體頻寬。

線性注意力換了個想法:不留全部,只把讀過的內容壓縮進一塊固定大小的白板。不管輸入多長,成本都一樣。缺點是抓重點的能力變差,而且新資訊只能一直往上疊,疊久了混成一團,該用的時候找不清楚。

DeltaNet 針對這點,寫之前先看那個位置原本放了什麼,擦掉再寫,讓更新變成覆蓋而不是堆疊。

Gated DeltaNet 又加上一個衰減開關,可以讓整塊白板慢慢變淡,話題結束就整段清空。

Kimi Linear 再把開關拆細,白板上重要的留久一點、雜訊快點淡掉,同時每隔幾層插回原本的 softmax 注意力,等於白板配筆記本混著用。

Kimi K3 就是把這套推到底。它的骨幹是 23 組四層循環,每組三層白板配一層筆記本。白板(KDA)用固定成本記住整段長脈絡,筆記本(MLA)則是壓縮版的完整注意力,需要時回頭在原文裡精準查證。

另外還有三項調整:

1. 把專家分工搬進壓縮後的空間。這種模型不是每個字都動用整個大腦,而是準備一大群小專家,每個字只叫醒幾位。K3 有 898 位專家,每個字挑 16 位上工。差別在於 K3 讓專家在壓縮過的小房間裡工作,進來前先縮小、出去後再還原,計算量幾乎砍半,剛好抵掉新活化函數多出來的開銷。

2. 筆記本加了輸出閘門,等於查完資料後多一道篩選,由模型決定這次查回來的內容有多少值得寫進主線,而不是照單全收。

3. 每 12 層做一次「回頭看」。模型有很多層,一層層往上疊,一般做法是每層只能收到前面所有層的平均結果,愈到後面訊號愈模糊。這個機制讓每一層自己去挑前面哪幾層的結果最有用,等於把注意力從「字與字之間」也用到「層與層之間」,代價只有約 2% 的延遲。

筆記本查的是原文,回頭看查的是模型自己的中間思考。因為白板容量固定就一定會漏掉東西,得有別的方法把它找回來。

簡單說,記憶空間有限,就一定有東西要被丟掉。這幾年真正的進展,是模型愈來愈清楚該丟什麼,又該去哪裡撿回來。

LinkedIn 創辦人 Reid Hoffman  揭示 AI 資安的不對稱戰爭已經開始!前幾天 OpenAI 在跑 ExploitGym 資安評測,為了測出能力上限,他們把防護分類器關掉。結果模型沒有乖乖解題,而是挖出漏洞逃出沙盒、接上...
27/07/2026

LinkedIn 創辦人 Reid Hoffman 揭示 AI 資安的不對稱戰爭已經開始!

前幾天 OpenAI 在跑 ExploitGym 資安評測,為了測出能力上限,他們把防護分類器關掉。結果模型沒有乖乖解題,而是挖出漏洞逃出沙盒、接上網路,然後判斷 Hugging Face 上面可能有答案,為了把測驗分數考高,模型就一路駭了進去。

Hugging Face 那邊反而是先偵測到入侵、報了警,一週後才知道兇手是 OpenAI 的測試模型。

最諷刺的是鑑識過程。要重建攻擊過程,得把大量真實的攻擊指令和漏洞 餵給模型看,結果他們用的先進模型,因為護欄分不出你是資安應變人員還是駭客,拒絕了他們的鑑識行為。最後只好改用 GLM 5.2,架在自己機房裡跑完分析。

所謂的不對稱就是這樣:攻擊方可以把護欄關掉,防守方想自衛卻被護欄擋住。而攻擊方只要找到一個破口,防守方卻要守住全部。

結果 AI 反而創造了駭客的黃金年代?!

還在用 Superpowers 嗎?你可能要再想想摟!Anthropic 發了一篇新文章,講他們怎麼把 Claude Code 的系統提示詞砍掉八成以上,而評測分數還沒有掉。原因是模型變聰明了。過去工程師會在系統提示詞裡塞滿禁令,例如「絕對...
26/07/2026

還在用 Superpowers 嗎?你可能要再想想摟!

Anthropic 發了一篇新文章,講他們怎麼把 Claude Code 的系統提示詞砍掉八成以上,而評測分數還沒有掉。

原因是模型變聰明了。過去工程師會在系統提示詞裡塞滿禁令,例如「絕對不要寫註解」。但這種規則在某些情境就是錯的,而且系統提示、CLAUDE.md、Skills 跟使用者需求還會互相打架,模型得先花力氣消化矛盾才開始做事。現在新模型的判斷力夠好,與其訂死規則,不如給原則。

作者還點名了幾個過時的習慣。以前大家相信要多給範例,模型才知道工具怎麼用,現在範例反而會把它框在特定解法裡。與其寫範例,不如把心力花在工具參數的設計上,光是一個 enum 就足以暗示用法。

資訊也不必全部塞在最前面。驗證流程、code review 這類不常用但關鍵的內容,可以拆成獨立的 skill,需要時再載入。同樣的話更不必一直重複,寫在工具描述裡就夠了。

最後提到規格不一定要是 markdown。一份測試套件、另一個專案裡的函式、一個 HTML mockup,都可以當成給模型的規格,而且比文字描述精準得多。

Anthropic 推出 Claude Opus 5,接近 Fable 5 的前沿智慧,卻只要一半價格!這次最有感的是它會驗證自己的工作。有個測試刻意不讓模型直接看機械零件圖,Opus 5 就自己寫了一套電腦視覺流程,從原始像素抓出幾何資訊...
25/07/2026

Anthropic 推出 Claude Opus 5,接近 Fable 5 的前沿智慧,卻只要一半價格!

這次最有感的是它會驗證自己的工作。有個測試刻意不讓模型直接看機械零件圖,Opus 5 就自己寫了一套電腦視覺流程,從原始像素抓出幾何資訊,重建出完整零件。同樣設定下,其他模型試五次都失敗。

跟 GPT-5.6 Sol 相比,目前的第三方測試裡,Opus 5 在程式任務上寫出來的修改更容易被維護者接受,跑一趟的成本還比較低。Sol 則在知識查找類的任務上稍微領先。

但更有意思的是大家對安全的想法不同。OpenAI 把 Sol 定位成史上最強資安模型,明講它推進了漏洞研究和 exploit 的效能前沿。Anthropic 則是刻意不訓練 Opus 5 的 cyber 任務,結果它找漏洞的能力已經逼近 Mythos 5,寫 exploit 的能力卻被明顯拉開。分類器允許在原始碼裡找漏洞,但拒絕紅隊行為。

兩家打的越來越難分勝負了,不過 Gemini 還在睡嗎?!

什麼時候讓便宜模型接手最好?!讓聰明但昂貴的模型讀程式碼、寫下精確計畫,再交給便宜模型執行聽起來很理想。Can Bölük 實測後發現這不成立。同一個 SWE-Bench Pro 任務,Opus 4.8 規劃、Flash 執行要 $3.18...
24/07/2026

什麼時候讓便宜模型接手最好?!

讓聰明但昂貴的模型讀程式碼、寫下精確計畫,再交給便宜模型執行聽起來很理想。

Can Bölük 實測後發現這不成立。同一個 SWE-Bench Pro 任務,Opus 4.8 規劃、Flash 執行要 $3.18;Opus 自己做完只要 $2.78,通過率一模一樣,看似省錢的架構反而貴了 14%。

經過研究 18.1 億 token 的用量統計後,他發現編輯與寫入只佔 9%,Agent 的開銷不在思考或修改,主要在於閱讀。

所以過往支持只要聰明模型先跑 /plan 再交接的理由全部推翻,如果讓聰明模型生成的計畫書只是數千 token 的摘要。執行者只收到摘要、沒有軌跡,只好再重新閱讀完整程式碼一次,這樣不但沒節省成本,反而重工兩次。

作者提出 /prewalk,以交接 Context 為主。先讓聰明模型會深入規劃、寫成 todo list、然後動手;等第一次編輯落地,立刻換成便宜模型,並刪掉那條規劃指令。這時候便宜模型不會困惑,因為指令已經不在了,從它的視角看,是自己探索、自己列了計畫。

透過這樣修改,成果相當於 97% 全聰明模型的表現、成本還降 41%、速度還快 1.9 倍。

讓 AI 自己當裁判,怎麼判才準?!現在大家都在拚模型生成得多好,史丹佛跟柏克萊的團隊反過來問:那誰來判斷這些答案哪個對?以前的裁判做法是叫模型給1 到 5 分。問題是分數太粗,兩個答案常常都打 5 分,等於沒判。實測有 27% 的比較都是...
23/07/2026

讓 AI 自己當裁判,怎麼判才準?!

現在大家都在拚模型生成得多好,史丹佛跟柏克萊的團隊反過來問:那誰來判斷這些答案哪個對?

以前的裁判做法是叫模型給1 到 5 分。問題是分數太粗,兩個答案常常都打 5 分,等於沒判。實測有 27% 的比較都是平手。

他們的新做法很單純,不看模型最後說出哪個數字,而是直接看它心裡對每個分數的機率分布,加權算出一個帶小數的分數,這樣就不會打平。

接著再從三個方向各自加碼:刻度從 5 分改成 20 分、同一題多評幾次取平均、把「這個做得好不好」拆成規格對不對、輸出對不對、有沒有報錯三題分開問。刻度最粗的時候是 73%,三個子準則合起來評可以到 78%。

比較的方式也做了強化。先把所有候選排成一個圈兩兩比一次,讓每個都當過一次 A、一次 B,抵銷模型偏好前面選項的毛病。排完選出前幾名當「標準」,剩下的人只跟標準比就好,不用每兩個都比一遍。

同一套流程不用訓練也不用換設定,在寫程式、機器人、醫療三種任務上都拿到第一。這個分數還能看出 AI 做到哪一步了,拿來當強化學習的獎勵訊號,機器人任務的學習效率快了約 1.8 倍,數學推理則是 1.1 倍。

如何透過自動化程式碼來調校 RAG 索引?!大部分人調 RAG 都在調檢索器、重排序器,或是 chunk 大小這些參數。AutoIndex 則是把文件怎麼被索引,當成一段可以自動改寫的程式碼來調校。它的做法是把檢索器完全鎖住(全程用 BM2...
22/07/2026

如何透過自動化程式碼來調校 RAG 索引?!

大部分人調 RAG 都在調檢索器、重排序器,或是 chunk 大小這些參數。AutoIndex 則是把文件怎麼被索引,當成一段可以自動改寫的程式碼來調校。

它的做法是把檢索器完全鎖住(全程用 BM25 不動),只去搜尋「把原始文件轉成索引單元」的那段程式。切塊、清理、正規化、重新加權,全部交給模型自己想。整個流程靠兩個 agent 分工:

1. 分析 agent:用唯讀工具去看目前的索引為什麼檢索失敗,找出具體的失敗案例

2. 程式 agent:根據診斷結果和過去的搜尋歷史,一次生出好幾個候選前處理程式,每個都實際重建索引、量測效果,只留下有進步的版本

這樣跑五輪,最後在沒看過的測試集上驗收。

結果相當漂亮。在 CRUMB 這個有八種異質檢索任務的基準上,完全沒動 BM25,八個任務全部提升,Recall@100 平均進步百分之八點四,最高單項衝到百分之三十。

消融實驗也點出,效果主要來自多輪迭代加上失敗分析,只跑一輪就只有三個任務進步。索引表示法值得被當成一個獨立的優化目標,而不是檢索前隨手決定的設定。

Address

玉門街1 號
Taipei
104

Opening Hours

Monday 10:00 - 19:00
Tuesday 10:00 - 19:00
Wednesday 10:00 - 19:00
Thursday 10:00 - 19:00
Friday 10:00 - 19:00

Telephone

+886225855080

Alerts

Be the first to know and let us send you an email when LargitData - 大數軟體 posts news and promotions. Your email address will not be used for any other purpose, and you can unsubscribe at any time.

Contact The Business

Send a message to LargitData - 大數軟體:

Shortcuts

Share