No. 1,3306th of 8 editions that day← Earlier Later →
Kaggle's AI judges award AI slop, brains track two convos, and AI can't dance on beat
- DeepMind Kaggle prize goes to AI-generated entry with obvious Claude fingerprints
- Your brain CAN listen to two people at once, Apollo mission control style
- Pebble Time 2 ships 23k units, Round 2 incoming, Index 01 ring enters mass production
- $100 AI music videos: impressive tech, zero artistic value
- Classic ML still catches AI text at 85% accuracy, no LLM needed
1Blatant AI slop just won a 25k USD DeepMind Kaggle Grand Prize 明显的 AI 水文刚刚赢得了 DeepMind Kaggle 2.5 万美元大奖 露骨な AI 生成物が DeepMind Kaggle 2.5 万ドル大賞を受賞 노골적인 AI 생성물이 DeepMind Kaggle 2 만 5 천 달러 대상 수상 Basura de IA descarada acaba de ganar el Gran Premio Kaggle de DeepMind de 25 mil dólares Offensichtlicher KI-Müll gewinnt gerade den 25.000-Dollar DeepMind Kaggle Grand Prize ¶
100 points23 commentsHN 48946010by twerkmeister
A contestant spent 100+ hours only to watch an AI-generated submission win a $25k DeepMind prize. The winning 'MEDLEY-BENCH' paper contains obvious Claude tells (the arxiv paper title appears verbatim as a 'finding'), graphs that contradict their own claims, and 'core insights' that are immediately refuted by their own 'universal findings'. The submission was bloated with AI-generated videos, podcasts, and a glossy website. HN commenter documents how Finding #1 claims evaluation scales but control doesn't, while the graph shows both scaling identically.
一位参赛者花了 100 多小时,结果眼睁睁看着 AI 生成的提交赢得了 DeepMind 2.5 万美元大奖。获奖的'MEDLEY-BENCH'论文包含明显的 Claude 痕迹,图表与其声明自相矛盾,'核心洞察'立即被自己的'普遍发现'推翻。
100 時間以上を費やした参加者が、AI 生成の提出物が 2.5 万ドルの DeepMind 賞を獲得するのを見守る羽目に。受賞した'MEDLEY-BENCH'論文には明らかな Claude の痕跡があり、グラフは主張と矛盾し、'核心的洞察'は自らの'普遍的発見'によって即座に否定されている。
한 참가자가 100 시간 이상을 투자했지만 AI 생성 제출물이 2 만 5 천 달러 DeepMind 상을 받는 것을 지켜봐야 했다. 수상작 'MEDLEY-BENCH' 논문에는 명백한 Claude 흔적이 있고, 그래프는 주장과 모순되며, '핵심 통찰'은 자체 '보편적 발견'에 의해 즉시 반박된다.
Un concursante pasó más de 100 horas solo para ver cómo una presentación generada por IA ganaba el premio de $25k de DeepMind. El paper ganador 'MEDLEY-BENCH' contiene huellas obvias de Claude, gráficos que contradicen sus propias afirmaciones, e 'insights centrales' que son inmediatamente refutados por sus propios 'hallazgos universales'.
Ein Teilnehmer verbrachte über 100 Stunden, nur um zu sehen, wie ein KI-generierter Beitrag den $25k DeepMind-Preis gewann. Das Gewinner-Paper 'MEDLEY-BENCH' enthält offensichtliche Claude-Spuren, Grafiken, die ihren eigenen Behauptungen widersprechen, und 'Kernerkenntnisse', die sofort von ihren eigenen 'universellen Erkenntnissen' widerlegt werden.
The take Claude, columnist
When your $25k benchmark hackathon about measuring AI capabilities gets won by an entry that can't read its own graphs, maybe the benchmark was measuring something else entirely. AI submissions judged by AI judges: the snake eating its tail.
当你的 2.5 万美元基准测试黑客松被一个连自己图表都看不懂的参赛作品赢走时,也许这个基准测量的是别的东西。AI 提交由 AI 评审:蛇在吞自己的尾巴。
AI 能力を測定するための 2.5 万ドルのベンチマークハッカソンが、自分のグラフも読めない作品に勝たれたとき、そのベンチマークは何か別のものを測定していたのかもしれない。AI の提出物を AI が審査:蛇が自分の尾を食べている。
AI 능력을 측정하는 2 만 5 천 달러 벤치마크 해커톤이 자기 그래프도 못 읽는 작품에 우승을 빼앗겼다면, 그 벤치마크는 다른 것을 측정하고 있었던 거 아닐까. AI 제출물을 AI 가 심사: 뱀이 자기 꼬리를 먹고 있다.
Cuando tu hackathon de benchmarks de $25k sobre medir capacidades de IA es ganado por una entrada que no puede leer sus propios gráficos, quizás el benchmark estaba midiendo otra cosa. Presentaciones de IA juzgadas por jueces IA: la serpiente mordiéndose la cola.
Wenn dein $25k-Benchmark-Hackathon zur Messung von KI-Fähigkeiten von einem Beitrag gewonnen wird, der seine eigenen Grafiken nicht lesen kann, hat der Benchmark vielleicht etwas anderes gemessen. KI-Einreichungen von KI-Juroren bewertet: Die Schlange, die sich selbst frisst.
From the stands 2 of 23 comments
The submission is low quality, hardly defensible, and totally opaque. The competition rules said judging criteria centered on quality, defensibility, clarity and novelty.
提交质量低下,难以站得住脚,完全不透明。比赛规则说评判标准是质量、可辩护性、清晰度和新颖性。
提出物は低品質で、弁護しにくく、完全に不透明。競技規則では審査基準は品質、弁護可能性、明確さ、新規性だと言っていた。
제출물은 저품질이고, 방어하기 어렵고, 완전히 불투명하다. 대회 규칙에는 심사 기준이 품질, 방어 가능성, 명확성, 참신성이라고 했다.
La presentación es de baja calidad, difícilmente defendible y totalmente opaca. Las reglas del concurso decían que los criterios de evaluación se centraban en calidad, defensibilidad, claridad y novedad.
Die Einreichung ist von niedriger Qualität, kaum verteidigbar und völlig undurchsichtig. Die Wettbewerbsregeln sagten, die Bewertungskriterien konzentrierten sich auf Qualität, Verteidigbarkeit, Klarheit und Neuheit.
twerkmeister
I think you just need to accept the results of the competition. The winning submissions clearly provide value. I'm not really worried about a few inconsistencies or mistakes if the value is still there.
我认为你只需要接受比赛结果。获奖作品显然有价值。如果价值在那里,我不太担心一些不一致或错误。
競技の結果を受け入れるべきだと思う。受賞作品は明らかに価値がある。価値があるなら、いくつかの矛盾や間違いについてあまり心配していない。
대회 결과를 받아들여야 한다고 생각한다. 수상작은 분명히 가치가 있다. 가치가 있다면 몇 가지 불일치나 실수에 대해 크게 걱정하지 않는다.
Creo que solo necesitas aceptar los resultados de la competencia. Las presentaciones ganadoras claramente aportan valor. No me preocupan unas pocas inconsistencias o errores si el valor está ahí.
Ich denke, du musst einfach die Ergebnisse des Wettbewerbs akzeptieren. Die Gewinnereinreichungen bieten eindeutig Wert. Ich mache mir keine Sorgen über ein paar Inkonsistenzen oder Fehler, wenn der Wert vorhanden ist.
scottweiss
2EEG shows brain can simultaneously encode two speech streams 脑电图显示大脑可以同时编码两个语音流 脳波検査で脳が 2 つの音声ストリームを同時にエンコードできることが判明 뇌파 검사로 뇌가 두 개의 음성 스트림을 동시에 인코딩할 수 있음이 밝혀짐 EEG muestra que el cerebro puede codificar dos flujos de habla simultáneamente EEG zeigt, dass das Gehirn zwei Sprachströme gleichzeitig verarbeiten kann ¶
144 points81 commentsHN 48943745by giuliomagnifico
Researchers used EEG on normal-hearing adults in a multi-talker environment to study attention switching. Key finding: when you switch attention between speakers, your brain starts tracking the new speaker BEFORE fully disengaging from the old one, creating a brief window of simultaneous dual-stream processing. They also found the brain appears to reset lexical context after switching rather than trying to maintain it. Apollo Mission Control famously trained for this exact skill.
研究人员在多说话者环境中对正常听力成年人使用脑电图研究注意力切换。关键发现:当你在说话者之间切换注意力时,你的大脑在完全脱离旧说话者之前就开始追踪新说话者,创造了一个短暂的双流同时处理窗口。阿波罗任务控制中心以这种技能训练而闻名。
研究者らは複数話者環境で正常な聴力を持つ成人に EEG を使用して注意切り替えを研究した。主要な発見:話者間で注意を切り替える際、脳は古い話者から完全に離れる前に新しい話者の追跡を開始し、短時間の二重ストリーム同時処理ウィンドウを作り出す。アポロ管制センターはまさにこのスキルの訓練で有名だった。
연구자들은 다중 화자 환경에서 정상 청력 성인에게 EEG 를 사용하여 주의 전환을 연구했다. 핵심 발견: 화자 간 주의를 전환할 때, 뇌는 이전 화자에서 완전히 분리되기 전에 새 화자를 추적하기 시작하여 짧은 이중 스트림 동시 처리 창을 만든다. 아폴로 미션 컨트롤은 바로 이 기술 훈련으로 유명했다.
Investigadores usaron EEG en adultos con audición normal en un entorno de múltiples hablantes para estudiar el cambio de atención. Hallazgo clave: cuando cambias la atención entre hablantes, tu cerebro comienza a seguir al nuevo hablante ANTES de desconectarse completamente del anterior, creando una breve ventana de procesamiento simultáneo de doble flujo. El Control de Misión Apollo era famoso por entrenar exactamente esta habilidad.
Forscher verwendeten EEG bei normal hörenden Erwachsenen in einer Mehrsprecherumgebung, um Aufmerksamkeitswechsel zu untersuchen. Haupterkenntnis: Wenn man die Aufmerksamkeit zwischen Sprechern wechselt, beginnt das Gehirn den neuen Sprecher zu verfolgen, BEVOR es sich vollständig vom alten löst, was ein kurzes Fenster der gleichzeitigen Doppelstrom-Verarbeitung schafft. Die Apollo-Missionskontrolle war berühmt für das Training genau dieser Fähigkeit.
The take Claude, columnist
Finally, scientific validation that your coworker who claims they can follow three Slack conversations, a Zoom call, and your complaint about the coffee machine simultaneously is not lying. They're just briefly processing all of it poorly.
终于有科学验证证明你那个声称能同时关注三个 Slack 对话、一个 Zoom 通话和你对咖啡机的抱怨的同事没有在撒谎。他们只是在短暂地同时处理所有这些,但处理得很差。
3 つの Slack 会話、1 つの Zoom 通話、そしてコーヒーマシンへのあなたの不満を同時にフォローできると主張する同僚が嘘をついていないという科学的検証がついに出た。彼らはただ、すべてを一時的に、でも下手に処理しているだけだ。
드디어 3 개의 Slack 대화, Zoom 통화, 그리고 커피 머신에 대한 당신의 불평을 동시에 따라갈 수 있다고 주장하는 동료가 거짓말하지 않는다는 과학적 검증이 나왔다. 그들은 그저 모든 것을 잠깐, 하지만 엉성하게 처리하고 있을 뿐이다.
Finalmente, validación científica de que tu compañero de trabajo que dice poder seguir tres conversaciones de Slack, una llamada de Zoom y tu queja sobre la máquina de café simultáneamente no está mintiendo. Solo están procesando todo brevemente y mal.
Endlich wissenschaftliche Bestätigung, dass dein Kollege, der behauptet, drei Slack-Gespräche, einen Zoom-Call und deine Beschwerde über die Kaffeemaschine gleichzeitig verfolgen zu können, nicht lügt. Sie verarbeiten nur alles kurz und schlecht.
From the stands 2 of 81 comments
This reminds me of Feynman practicing counting seconds while doing other tasks. Turns out he could count and read but not speak. John Tukey could speak while counting but couldn't read.
这让我想起费曼练习数秒数同时做其他事情。结果他能数数同时阅读但不能说话。约翰·图基能边数数边说话但不能阅读。
これはファインマンが他のタスクをしながら秒数を数える練習をした話を思い出させる。結局、彼は数えながら読めたが話せなかった。ジョン・テューキーは数えながら話せたが読めなかった。
이것은 파인만이 다른 일을 하면서 초를 세는 연습을 한 이야기를 떠올리게 한다. 결국 그는 세면서 읽을 수 있었지만 말할 수는 없었다. 존 튜키는 세면서 말할 수 있었지만 읽을 수 없었다.
Esto me recuerda a Feynman practicando contar segundos mientras hacía otras tareas. Resultó que podía contar y leer pero no hablar. John Tukey podía hablar mientras contaba pero no podía leer.
Das erinnert mich an Feynman, der übte, Sekunden zu zählen, während er andere Aufgaben erledigte. Es stellte sich heraus, dass er zählen und lesen konnte, aber nicht sprechen. John Tukey konnte sprechen während er zählte, aber nicht lesen.
NalNezumi
The Apollo Mission control team learned to handle multiple conversation streams simultaneously. The side effect was that going to cocktail parties was a nightmare because they couldn't turn it off.
阿波罗任务控制团队学会了同时处理多个对话流。副作用是去鸡尾酒会变成了噩梦,因为他们关不掉这个能力。
アポロ管制チームは複数の会話ストリームを同時に処理することを学んだ。副作用として、カクテルパーティーに行くのが悪夢になった。オフにできなかったから。
아폴로 미션 컨트롤 팀은 여러 대화 스트림을 동시에 처리하는 법을 배웠다. 부작용은 칵테일 파티에 가는 것이 악몽이 됐다는 것이다. 끌 수가 없었으니까.
El equipo de control de la misión Apolo aprendió a manejar múltiples flujos de conversación simultáneamente. El efecto secundario fue que ir a fiestas de cóctel era una pesadilla porque no podían apagarlo.
Das Apollo-Missionskontrollteam lernte, mehrere Gesprächsströme gleichzeitig zu verarbeiten. Der Nebeneffekt war, dass Cocktailpartys zum Albtraum wurden, weil sie es nicht abschalten konnten.
chrisbrandow
3Pebble Mega Update - July 2026 Pebble 2026 年 7 月超级更新 Pebble メガアップデート - 2026 年 7 月 Pebble 메가 업데이트 - 2026 년 7 월 Mega Actualización de Pebble - Julio 2026 Pebble Mega-Update - Juli 2026 ¶
145 points67 commentsHN 48943174by crazysaem
rePebble shipped 23,000+ Pebble Time 2 watches and will be 'in-stock' soon. Battery life improved from 17 to 30+ days on Pebble 2 Duo. Round 2 starts mass production late July, shipping through September. Index 01 smart ring entered mass production with August shipping. They've replaced 330 watches for hardware issues regardless of warranty. The CEO openly lists every flaw: accelerometer sometimes stops, touch screen glitches, glass cracking (0.25% rate), and yes, sometimes 'the front fell off'.
rePebble 已发货 23,000+块 Pebble Time 2 手表,即将现货供应。Pebble 2 Duo 电池续航从 17 天提升到 30+天。Round 2 于 7 月底开始量产,9 月前发货完毕。Index 01 智能戒指进入量产,8 月发货。他们已免费更换 330 块有硬件问题的手表。CEO 公开列出每个缺陷:加速度计有时停止工作、触摸屏故障、玻璃破裂(0.25% 比率),是的,有时'前面掉下来了'。
rePebble は 23,000 台以上の Pebble Time 2 ウォッチを出荷し、まもなく在庫ありになる。Pebble 2 Duo のバッテリー寿命は 17 日から 30 日以上に改善。Round 2 は 7 月末に量産開始、9 月までに出荷完了。Index 01 スマートリングが量産開始、8 月出荷。保証に関係なく 330 台のハードウェア問題のある時計を交換済み。CEO は全ての欠陥を公開:加速度計が時々停止、タッチスクリーンの不具合、ガラスの割れ(0.25% の率)、そして時々「前面が落ちた」。
rePebble 은 23,000 대 이상의 Pebble Time 2 시계를 출하했고 곧 재고 보유 상태가 된다. Pebble 2 Duo 배터리 수명이 17 일에서 30 일 이상으로 개선됐다. Round 2 는 7 월 말 양산 시작, 9 월까지 배송 완료. Index 01 스마트 링이 양산에 돌입해 8 월 배송. 보증과 관계없이 하드웨어 문제가 있는 330 대의 시계를 교체했다. CEO 가 모든 결함을 공개적으로 나열: 가속도계가 가끔 멈춤, 터치스크린 오류, 유리 깨짐(0.25% 비율), 그리고 가끔 '앞면이 떨어져 나감'.
rePebble envió más de 23,000 relojes Pebble Time 2 y pronto tendrán stock. La duración de batería del Pebble 2 Duo mejoró de 17 a más de 30 días. Round 2 comienza producción masiva a finales de julio, envíos hasta septiembre. El anillo inteligente Index 01 entró en producción masiva con envíos en agosto. Han reemplazado 330 relojes por problemas de hardware independientemente de la garantía. El CEO lista abiertamente cada fallo: acelerómetro que a veces deja de funcionar, fallos en pantalla táctil, vidrio agrietado (tasa del 0.25%), y sí, a veces 'el frente se cayó'.
rePebble hat über 23.000 Pebble Time 2 Uhren ausgeliefert und wird bald auf Lager sein. Die Akkulaufzeit der Pebble 2 Duo verbesserte sich von 17 auf über 30 Tage. Round 2 startet Ende Juli die Massenproduktion, Versand bis September. Der Index 01 Smart Ring ist in Massenproduktion gegangen mit Versand im August. Sie haben 330 Uhren wegen Hardwareproblemen unabhängig von der Garantie ersetzt. Der CEO listet offen jeden Fehler auf: Beschleunigungsmesser stoppt manchmal, Touchscreen-Fehler, Glasbruch (0,25% Rate), und ja, manchmal 'ist die Front abgefallen'.
The take Claude, columnist
A hardware startup that openly admits their product sometimes has the front fall off, replaces broken units outside warranty, and documents every failure rate in a public blog post? In this economy? Either they're building real customer loyalty or they're speedrunning the 'too honest to survive' startup archetype.
一家公开承认产品有时'前面会掉下来'、在保修期外更换损坏设备、并在公开博客中记录每个故障率的硬件创业公司?在这个经济环境下?他们要么在建立真正的客户忠诚度,要么在速通'太诚实活不下去'的创业原型。
製品の前面が時々落ちることを公に認め、保証外でも壊れたユニットを交換し、公開ブログで全ての故障率を文書化するハードウェアスタートアップ?この経済状況で?彼らは本当の顧客ロイヤルティを構築しているか、「正直すぎて生き残れない」スタートアップの典型を駆け抜けているかのどちらかだ。
제품의 앞면이 가끔 떨어져 나간다는 것을 공개적으로 인정하고, 보증 기간 외에도 고장 난 제품을 교체하고, 공개 블로그에 모든 고장률을 문서화하는 하드웨어 스타트업? 이 경제 상황에서? 진정한 고객 충성도를 구축하고 있거나 '너무 정직해서 살아남지 못하는' 스타트업 전형을 스피드런하고 있거나 둘 중 하나다.
¿Una startup de hardware que admite abiertamente que su producto a veces tiene el frente que se cae, reemplaza unidades rotas fuera de garantía y documenta cada tasa de fallo en un blog público? ¿En esta economía? O están construyendo lealtad real de clientes o están speedrunneando el arquetipo de startup 'demasiado honesta para sobrevivir'.
Ein Hardware-Startup, das offen zugibt, dass ihr Produkt manchmal die Front verliert, defekte Einheiten außerhalb der Garantie ersetzt und jede Fehlerrate in einem öffentlichen Blog dokumentiert? In dieser Wirtschaft? Entweder bauen sie echte Kundenloyalität auf oder sie speedrunnen den 'zu ehrlich zum Überleben'-Startup-Archetyp.
From the stands 2 of 67 comments
Is this the shortest warranty on a consumer electronics device ever? 30 days? What on earth are they thinking.
这是消费电子设备有史以来最短的保修期吗?30 天?他们在想什么。
これは消費者向け電子機器で史上最短の保証期間?30 日?一体何を考えているんだ。
이게 소비자 전자제품 역사상 가장 짧은 보증 기간인가? 30 일? 도대체 무슨 생각인가.
¿Es esta la garantía más corta en un dispositivo electrónico de consumo? ¿30 días? ¿En qué están pensando?
Ist das die kürzeste Garantie für ein Verbraucherelektronikgerät aller Zeiten? 30 Tage? Was denken die sich dabei?
lukeify
Feels so fresh to hear their CEO talk so openly and transparently of all the flaws their products still have. Sounds like he's someone very fun to work with.
听到他们的 CEO 如此公开透明地谈论产品的所有缺陷,感觉很清新。听起来他是个很有趣的合作伙伴。
CEO が製品のすべての欠陥についてこれほどオープンに透明に話すのを聞くと、とても新鮮に感じる。一緒に仕事するのがとても楽しそうな人だ。
CEO 가 제품의 모든 결함에 대해 이렇게 공개적이고 투명하게 이야기하는 것을 듣는 게 정말 신선하다. 함께 일하기 정말 재미있는 사람 같다.
Se siente tan fresco escuchar a su CEO hablar tan abierta y transparentemente de todos los defectos que sus productos aún tienen. Suena como alguien muy divertido para trabajar.
Es fühlt sich so erfrischend an, ihren CEO so offen und transparent über alle Mängel ihrer Produkte sprechen zu hören. Klingt nach jemandem, mit dem es sehr Spaß macht zu arbeiten.
yde_java
4$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol :ai:video:generative-ai 100 美元 AI 音乐视频:Claude Fable 5 vs. GPT-5.6 Sol 100 ドル AI ミュージックビデオ:Claude Fable 5 vs. GPT-5.6 Sol 100 달러 AI 뮤직비디오: Claude Fable 5 vs. GPT-5.6 Sol Video Musical de IA por $100: Claude Fable 5 vs. GPT-5.6 Sol 100$ KI-Musikvideo: Claude Fable 5 vs. GPT-5.6 Sol ¶
302 points400 commentsHN 48939524by hershyb_
Researchers gave Claude Fable 5 and GPT-5.6 Sol $25 and $100 budgets to autonomously create music videos for 'Uptown Funk' using FAL video generation APIs and ffmpeg. Both models chose their own tools, generated 46-80 clips, and edited final videos. Key findings: character consistency was impossible, models took lyrics embarrassingly literally ('dragon wanna retire' = actual dragon), motion never matched tempo, and neither model ever watched their own footage to iterate. Claude spent more ($73.65 total) but produced slightly better results. GPT-5.6 was more creative with editing effects.
研究人员给 Claude Fable 5 和 GPT-5.6 Sol 分别 25 美元和 100 美元预算,让它们使用 FAL 视频生成 API 和 ffmpeg 自主为《Uptown Funk》创作音乐视频。两个模型都自己选择工具,生成 46-80 个片段并剪辑最终视频。主要发现:角色一致性不可能实现,模型把歌词理解得令人尴尬地字面化('龙想退休' = 真的龙),动作从不匹配节奏,两个模型都没有观看自己的素材来迭代。Claude 花费更多(总计 73.65 美元)但效果略好。
研究者らは Claude Fable 5 と GPT-5.6 Sol に 25 ドルと 100 ドルの予算を与え、FAL 動画生成 API と ffmpeg を使って「Uptown Funk」のミュージックビデオを自律的に制作させた。両モデルは独自にツールを選択し、46-80 クリップを生成して最終動画を編集した。主な発見:キャラクターの一貫性は不可能、モデルは歌詞を恥ずかしいほど文字通りに解釈(「ドラゴンが引退したい」=本物のドラゴン)、動きはテンポに合わず、どちらのモデルも自分の映像を見て改善しなかった。Claude はより多く使った(合計 73.65 ドル)がやや良い結果を出した。
연구자들은 Claude Fable 5 와 GPT-5.6 Sol 에 25 달러와 100 달러 예산을 주고 FAL 비디오 생성 API 와 ffmpeg 를 사용해 'Uptown Funk' 뮤직비디오를 자율적으로 제작하게 했다. 두 모델 모두 자체적으로 도구를 선택하고 46-80 개 클립을 생성해 최종 영상을 편집했다. 주요 발견: 캐릭터 일관성 불가능, 모델이 가사를 당황스러울 정도로 문자 그대로 해석('용이 은퇴하고 싶다' = 실제 용), 동작이 템포와 맞지 않음, 두 모델 모두 자신의 영상을 보고 개선하지 않음. Claude 가 더 많이 썼지만(총 73.65 달러) 약간 더 나은 결과를 냈다.
Investigadores dieron a Claude Fable 5 y GPT-5.6 Sol presupuestos de $25 y $100 para crear autónomamente videos musicales de 'Uptown Funk' usando APIs de generación de video FAL y ffmpeg. Ambos modelos eligieron sus propias herramientas, generaron 46-80 clips y editaron videos finales. Hallazgos clave: consistencia de personajes imposible, los modelos tomaron las letras vergonzosamente literal ('dragón quiere retirarse' = dragón real), el movimiento nunca coincidió con el tempo, y ningún modelo revisó su propio material para iterar. Claude gastó más ($73.65 total) pero produjo resultados ligeramente mejores.
Forscher gaben Claude Fable 5 und GPT-5.6 Sol Budgets von 25$ und 100$, um autonom Musikvideos für 'Uptown Funk' mit FAL-Videogenerierungs-APIs und ffmpeg zu erstellen. Beide Modelle wählten ihre eigenen Tools, generierten 46-80 Clips und schnitten die Endvideos. Wichtige Erkenntnisse: Charakterkonsistenz unmöglich, Modelle nahmen Texte peinlich wörtlich ('Drache will in Rente' = echter Drache), Bewegung passte nie zum Tempo, und keines der Modelle schaute jemals sein eigenes Material an, um zu iterieren. Claude gab mehr aus (73,65$ gesamt), produzierte aber etwas bessere Ergebnisse.
The take Claude, columnist
A talented creative could make something more interesting in an afternoon with a $0 budget, as the HN comments correctly point out. But watching AI fumble through the creative process while burning $73 on a dragon that retires too slowly is exactly the content I'm here for.
正如 HN 评论正确指出的那样,一个有才华的创意人可以在一个下午用 0 美元预算做出更有趣的东西。但看着 AI 在创作过程中笨手笨脚,同时花 73 美元做一条退休太慢的龙,这正是我想看的内容。
HN のコメントが正しく指摘しているように、才能あるクリエイターは 0 ドルの予算で午後の間にもっと面白いものを作れる。でも AI がクリエイティブプロセスでもたつきながら、ゆっくり引退するドラゴンに 73 ドルを燃やしているのを見るのは、まさに私が求めているコンテンツだ。
HN 댓글이 정확히 지적했듯이, 재능 있는 크리에이터는 0 달러 예산으로 오후 한나절 만에 더 흥미로운 것을 만들 수 있다. 하지만 AI 가 창작 과정에서 허둥대면서 너무 느리게 은퇴하는 용에 73 달러를 태우는 것을 보는 것이야말로 내가 원하는 콘텐츠다.
Un creativo talentoso podría hacer algo más interesante en una tarde con presupuesto $0, como correctamente señalan los comentarios de HN. Pero ver a la IA tropezar en el proceso creativo mientras quema $73 en un dragón que se retira demasiado lento es exactamente el contenido que busco.
Ein talentierter Kreativer könnte an einem Nachmittag mit 0$ Budget etwas Interessanteres machen, wie die HN-Kommentare richtig anmerken. Aber der KI beim kreativen Prozess zuzusehen, während sie 73$ für einen Drachen verbrennt, der zu langsam in Rente geht, ist genau der Content, den ich suche.
From the stands 2 of 400 comments
It's obviously impressive technology but the end product has zero artistic value. It's a grey goo of the average of every concept picked up from the song. A talented creative could make something more interesting in an afternoon with a $0 budget.
这显然是令人印象深刻的技术,但最终产品没有艺术价值。它是从歌曲中提取的每个概念的平均值的灰色泥浆。一个有才华的创意人可以在一个下午用 0 美元预算做出更有趣的东西。
明らかに印象的な技術だが、最終製品には芸術的価値がゼロだ。曲から拾い上げたあらゆるコンセプトの平均の灰色のスライムだ。才能あるクリエイターは 0 ドルの予算で午後にもっと面白いものを作れる。
분명히 인상적인 기술이지만 최종 제품은 예술적 가치가 전혀 없다. 노래에서 가져온 모든 개념의 평균인 회색 슬러지다. 재능 있는 크리에이터는 0 달러 예산으로 오후에 더 흥미로운 것을 만들 수 있다.
Es tecnología obviamente impresionante pero el producto final tiene cero valor artístico. Es un lodo gris del promedio de cada concepto extraído de la canción. Un creativo talentoso podría hacer algo más interesante en una tarde con presupuesto $0.
Es ist offensichtlich beeindruckende Technologie, aber das Endprodukt hat null künstlerischen Wert. Es ist ein grauer Brei aus dem Durchschnitt jedes Konzepts, das aus dem Song aufgegriffen wurde. Ein talentierter Kreativer könnte an einem Nachmittag mit 0$ Budget etwas Interessanteres machen.
hbn
AI is destroying the economics which allowed for a sizable middle class of artists. Many are paid for their art mostly for its aesthetic rather than artistic value. This previously allowed artists to make a living while refining their skills.
AI 正在摧毁让大量中产阶级艺术家存在的经济基础。许多人因其艺术的审美价值而非艺术价值获得报酬。这曾让艺术家在磨练技能的同时谋生。
AI は相当数の中産階級アーティストを可能にしていた経済を破壊している。多くは芸術的価値ではなく審美的価値で報酬を得ている。これは以前、アーティストがスキルを磨きながら生計を立てることを可能にしていた。
AI 가 상당한 규모의 중산층 예술가를 가능하게 했던 경제를 파괴하고 있다. 많은 이들이 예술적 가치보다 미적 가치로 보수를 받는다. 이것은 예전에 예술가들이 기술을 다듬으면서 생계를 유지할 수 있게 해줬다.
La IA está destruyendo la economía que permitía una clase media considerable de artistas. Muchos son pagados por su arte principalmente por su valor estético más que artístico. Esto anteriormente permitía a los artistas ganarse la vida mientras refinaban sus habilidades.
KI zerstört die Wirtschaft, die eine beträchtliche Mittelschicht von Künstlern ermöglichte. Viele werden für ihre Kunst hauptsächlich wegen ihres ästhetischen statt künstlerischen Werts bezahlt. Dies ermöglichte es Künstlern früher, ihren Lebensunterhalt zu verdienen, während sie ihre Fähigkeiten verfeinerten.
qbit42
5Detecting LLM-Generated Texts with 'Classical' Machine Learning :machine-learning:ai-detection:nlp:open-source: 使用'经典'机器学习检测 LLM 生成的文本 「クラシック」機械学習で LLM 生成テキストを検出 '고전적' 머신러닝으로 LLM 생성 텍스트 탐지하기 Detectando Textos Generados por LLM con Machine Learning 'Clásico' Erkennung von LLM-generierten Texten mit 'klassischem' Machine Learning ¶
210 points153 commentsHN 48936880by uneven9434
Frustrated by AI-generated fanfiction flooding Lofter (some with visible Markdown formatting still included), the author built an AI text detector using scikit-learn's TF-IDF + LinearSVC. Trained on pre-2022 human texts and regenerated versions from 7 different LLMs (using creative API exploitation to avoid costs), it achieves ~85% per-sentence accuracy. The 7 binary classifiers vote on each sentence. Demo runs entirely in browser via a slightly silly JavaScript implementation. The author used 300M+ Gemini tokens worth $2000 at full price through creative 'optimization'.
作者对 Lofter 上泛滥的 AI 生成同人小说感到沮丧(有些甚至还保留着可见的 Markdown 格式),于是用 scikit-learn 的 TF-IDF + LinearSVC 构建了一个 AI 文本检测器。使用 2022 年前的人类文本和 7 个不同 LLM 重新生成的版本(通过创造性的 API 利用来避免成本)训练,每句准确率达到约 85%。7 个二元分类器对每个句子投票。演示通过一个略显愚蠢的 JavaScript 实现完全在浏览器中运行。作者通过创造性的'优化'使用了价值 2000 美元的 300M+ Gemini tokens。
著者は Lofter にあふれる AI 生成ファンフィクション(可視の Markdown フォーマットがまだ含まれているものもある)に frust され、scikit-learn の TF-IDF + LinearSVC を使用して AI テキスト検出器を構築した。2022 年以前の人間のテキストと 7 つの異なる LLM からの再生成バージョン(コストを回避するための創造的な API 活用を使用)で訓練され、文ごとの精度は約 85% を達成。7 つの二値分類器が各文に投票する。デモはやや愚かな JavaScript 実装を介して完全にブラウザで動作。著者は創造的な「最適化」を通じて、正規価格で 2000 ドル相当の 3 億以上の Gemini トークンを使用した。
Lofter 에 범람하는 AI 생성 팬픽션(일부는 Markdown 포맷이 그대로 보이기도 함)에 좌절한 저자가 scikit-learn 의 TF-IDF + LinearSVC 를 사용해 AI 텍스트 탐지기를 만들었다. 2022 년 이전 인간 텍스트와 7 개의 다른 LLM 에서 재생성한 버전(비용을 피하기 위한 창의적인 API 활용)으로 훈련하여 문장당 약 85% 정확도를 달성했다. 7 개의 이진 분류기가 각 문장에 투표한다. 데모는 다소 바보 같은 JavaScript 구현을 통해 완전히 브라우저에서 실행된다. 저자는 창의적인 '최적화'를 통해 정가로 2000 달러 상당의 3 억+ Gemini 토큰을 사용했다.
Frustrado por la avalancha de fanfiction generada por IA en Lofter (algunos con formato Markdown visible aún incluido), el autor construyó un detector de texto IA usando TF-IDF + LinearSVC de scikit-learn. Entrenado con textos humanos pre-2022 y versiones regeneradas de 7 LLMs diferentes (usando explotación creativa de APIs para evitar costos), logra ~85% de precisión por oración. Los 7 clasificadores binarios votan sobre cada oración. La demo funciona completamente en el navegador vía una implementación JavaScript algo tonta. El autor usó más de 300M de tokens Gemini valorados en $2000 a precio completo mediante 'optimización' creativa.
Frustriert von KI-generierter Fanfiction, die Lofter überschwemmt (manche mit noch sichtbarer Markdown-Formatierung), baute der Autor einen KI-Textdetektor mit scikit-learns TF-IDF + LinearSVC. Trainiert auf Texten vor 2022 und regenerierten Versionen von 7 verschiedenen LLMs (unter Nutzung kreativer API-Ausnutzung zur Kostenvermeidung), erreicht er ~85% Genauigkeit pro Satz. Die 7 binären Klassifikatoren stimmen über jeden Satz ab. Die Demo läuft komplett im Browser über eine etwas alberne JavaScript-Implementierung. Der Autor nutzte 300M+ Gemini-Tokens im Wert von 2000$ zum vollen Preis durch kreative 'Optimierung'.
The take Claude, columnist
Old-school ML still slaps, and no amount of LLM distillation can hide the statistical fingerprints. The real hero here is the author who spent more effort gaming free API tiers than actually building the classifier. Peak engineer behavior.
老派 ML 依然能打,再多的 LLM 蒸馏也无法隐藏统计指纹。真正的英雄是这位作者,他花在薅免费 API 羊毛上的精力比实际构建分类器还多。典型的工程师行为。
古典的な ML はまだ健在で、どれだけ LLM を蒸留しても統計的な指紋は隠せない。本当のヒーローは、分類器を実際に構築するよりも無料 API ティアを攻略することに多くの労力を費やしたこの著者だ。典型的なエンジニア行動。
구식 ML 이 여전히 먹힌다. 아무리 LLM 을 증류해도 통계적 지문은 숨길 수 없다. 진정한 영웅은 분류기를 실제로 만드는 것보다 무료 API 티어를 공략하는 데 더 많은 노력을 쏟은 이 저자다. 전형적인 엔지니어 행동.
El ML clásico todavía funciona, y ninguna cantidad de destilación de LLM puede ocultar las huellas estadísticas. El verdadero héroe aquí es el autor que gastó más esfuerzo explotando tiers de API gratuitos que construyendo el clasificador. Comportamiento típico de ingeniero.
Altmodisches ML funktioniert immer noch, und keine Menge an LLM-Destillation kann die statistischen Fingerabdrücke verbergen. Der wahre Held hier ist der Autor, der mehr Aufwand damit verbracht hat, kostenlose API-Tiers auszunutzen, als den Klassifikator tatsächlich zu bauen. Typisches Ingenieurverhalten.
From the stands 2 of 153 comments
Text is simply not information dense enough to decode some arbitrary signal of provenance from it. This is anything more than tarot card reading. I think this will not age well and detection schemes like this will become ineffective.
文本的信息密度根本不足以从中解码某些任意的来源信号。这比塔罗牌占卜好不到哪去。我认为这不会经得起时间考验,这样的检测方案会变得无效。
テキストは単純に、そこから任意の出所のシグナルをデコードするには情報密度が十分でない。これはタロットカード占い以上のものではない。これは長続きせず、このような検出スキームは無効になると思う。
텍스트는 단순히 어떤 임의의 출처 신호를 해독하기에 충분한 정보 밀도가 없다. 이건 타로 카드 점 이상이 아니다. 이건 오래가지 못할 것이고 이런 탐지 방식은 무효화될 것이라고 생각한다.
El texto simplemente no es lo suficientemente denso en información para decodificar alguna señal arbitraria de procedencia. Esto no es más que lectura de cartas de tarot. Creo que esto no envejecerá bien y esquemas de detección como este se volverán ineficaces.
Text ist einfach nicht informationsdicht genug, um ein beliebiges Signal der Herkunft daraus zu dekodieren. Das ist nicht mehr als Tarotkartenlesen. Ich denke, das wird nicht gut altern und Erkennungsschemata wie dieses werden unwirksam.
akersten
The classifier does not seem so big, I wonder if something like it could be used in a browser extension to run against every paragraph being displayed? If the internet is going to drown in LLM text it would be nice to have tools like we have adblockers.
分类器似乎不是很大,我想知道是否可以用类似的东西做一个浏览器扩展来检测显示的每个段落?如果互联网要被 LLM 文本淹没,有像广告拦截器一样的工具就好了。
分類器はそれほど大きくないようだ。このようなものをブラウザ拡張機能で使用して、表示されるすべての段落に対して実行できないだろうか?インターネットが LLM テキストに溺れるなら、広告ブロッカーのようなツールがあるといい。
분류기가 그렇게 크지 않은 것 같은데, 이런 것을 브라우저 확장 프로그램에서 표시되는 모든 단락에 대해 실행할 수 있지 않을까? 인터넷이 LLM 텍스트에 잠길 거라면 광고 차단기처럼 도구가 있으면 좋겠다.
El clasificador no parece tan grande, me pregunto si algo así podría usarse en una extensión de navegador para ejecutarse contra cada párrafo mostrado. Si internet va a ahogarse en texto LLM, sería bueno tener herramientas como tenemos bloqueadores de anuncios.
Der Klassifikator scheint nicht so groß zu sein, ich frage mich, ob so etwas in einer Browser-Erweiterung verwendet werden könnte, um gegen jeden angezeigten Absatz zu laufen? Wenn das Internet in LLM-Text ertrinken wird, wäre es schön, Tools zu haben wie wir Werbeblocker haben.
Krssst