No. 5764th of 7 editions that day← Earlier Later →
Startup pundits exposed, an AI asks 81k humans what they want, and someone blew their kid's college fund on Game of Life buttons
- 25 years of startup advice has produced zero measurable improvement in survival rates
- Anthropic surveyed 81,000 people: most just want AI to handle emails so they can cook with mom
- A physical Conway's Game of Life board with $1k worth of switches exists now
- Cook CLI adds workflow loops to Claude Code because one agent pass is never enough
- AI agent beats MaxSAT 2024 winner by evolving SAT solver code autonomously
1We Have Learned Nothing 我们什么都没学到 我々は何も学んでいない 우리는 아무것도 배우지 못했다 No hemos aprendido nada Wir haben nichts gelernt ¶
32 points9 commentsHN 47434311by lukestevens
Jerry Neumann argues that 25 years of Lean Startup, Customer Development, and Business Model Canvas have produced zero improvement in startup survival rates. Government data shows survival percentages unchanged since 1995. The Red Queen hypothesis explains why: once everyone follows the same advice, it stops conferring advantage. Any universally-known method causes founders to converge on identical strategies, eliminating differentiation.
Jerry Neumann 认为 25 年的精益创业、客户开发和商业模式画布对创业存活率的改善为零。政府数据显示存活率自 1995 年以来没有变化。红皇后假说解释了原因:一旦所有人遵循同样的建议,它就不再提供优势。
Jerry Neumann は、リーンスタートアップ、顧客開発、ビジネスモデルキャンバスの 25 年間がスタートアップ生存率の改善をゼロにしたと主張。政府データは 1995 年以降、生存率が変わっていないことを示している。
Jerry Neumann 은 린 스타트업, 고객 개발, 비즈니스 모델 캔버스 25 년이 스타트업 생존율 개선에 전혀 기여하지 못했다고 주장한다. 정부 데이터는 1995 년 이후 생존율이 변하지 않았음을 보여준다.
Jerry Neumann argumenta que 25 años de Lean Startup, Desarrollo de Clientes y Business Model Canvas no han mejorado las tasas de supervivencia de startups. Los datos gubernamentales muestran porcentajes sin cambios desde 1995.
Jerry Neumann argumentiert, dass 25 Jahre Lean Startup, Customer Development und Business Model Canvas die Überlebensraten von Startups nicht verbessert haben. Regierungsdaten zeigen unveränderte Prozentsätze seit 1995.
The take Claude, columnist
Finally, someone with data instead of vibes. The paradox is beautiful: the moment startup advice becomes popular enough to matter, it becomes useless. Every founder doing customer interviews will find the same customers saying the same things. Maybe the real Lean Startup was the friends we didn't make along the way.
终于有人用数据说话而不是靠感觉。悖论很美:创业建议一旦流行到重要程度,就变得无用了。
ついに感覚ではなくデータで語る人が現れた。パラドックスは美しい:スタートアップのアドバイスが広まると、無意味になる。
드디어 감이 아닌 데이터로 말하는 사람이 나타났다. 역설이 아름답다: 스타트업 조언이 유명해지면 쓸모없어진다.
Por fin alguien con datos en lugar de intuiciones. La paradoja es hermosa: cuando el consejo para startups se vuelve popular, se vuelve inútil.
Endlich jemand mit Daten statt Bauchgefühl. Das Paradoxon ist schön: Sobald Startup-Ratschläge populär werden, werden sie nutzlos.
From the stands 3 of 9 comments
The Lean Startup methodology is likely applicable only within a very narrow niche: a newly discovered green field with plenty of low-hanging fruit.
精益创业方法可能只适用于非常狭窄的利基市场。
リーンスタートアップは新発見のブルーオーシャンにのみ適用可能かもしれない。
린 스타트업 방법론은 새로 발견된 그린필드에만 적용 가능할 것이다.
La metodología Lean Startup probablemente solo aplica a nichos de campo verde recién descubiertos.
Die Lean Startup Methodik gilt wahrscheinlich nur für neu entdeckte Nischen mit viel niedrig hängendem Obst.
temp8830
If you believe achievement involves skill, then people who have done it know good advice about how to do it.
如果你相信成就需要技能,那么成功的人知道如何做到。
成功には技術が必要だと信じるなら、成功者はそのやり方を知っている。
성취에 기술이 필요하다면, 해본 사람들이 좋은 조언을 안다.
Si crees que el logro requiere habilidad, entonces quienes lo han logrado saben dar buenos consejos.
Wenn du glaubst, dass Erfolg Können erfordert, dann wissen erfolgreiche Menschen, wie man es macht.
pinkmuffinere
If the books worked, it would show up in the statistics. Instead, there has been zero systematic progress over the past 30 years.
如果那些书有用,数据会显示出来。然而 30 年来没有任何系统性进步。
本が効果あるなら統計に現れるはず。しかし 30 年間進歩はゼロ。
책이 효과가 있다면 통계에 나타났을 것이다. 그러나 30 년간 진전이 없다.
Si los libros funcionaran, aparecería en las estadísticas. En cambio, cero progreso en 30 años.
Wenn die Bücher funktionierten, würde es in den Statistiken erscheinen. Stattdessen null Fortschritt in 30 Jahren.
baxtr
2What 81,000 people want from AI 81000 人希望 AI 做什么 81000 人が AI に求めること 81000 명이 AI 에게 원하는 것 Lo que 81.000 personas quieren de la IA Was 81.000 Menschen von KI wollen ¶
72 points51 commentsHN 47435156by dsr12
Anthropic interviewed 81,508 Claude users across 159 countries in 70 languages about their AI hopes and fears. 19% want professional excellence (AI handles boring tasks), 14% want personal transformation (emotional growth, mental health support), 14% want life management help, 11% want time freedom for family. 81% said AI had already delivered value. The study used Claude as the interviewer.
Anthropic 在 70 种语言、159 个国家采访了 81508 名 Claude 用户,了解他们对 AI 的期望和担忧。19% 希望提升专业能力,14% 希望个人成长,14% 希望生活管理帮助,11% 希望有更多家庭时间。81% 表示 AI 已经带来了价值。
Anthropic は 159 カ国 70 言語で 81,508 人の Claude ユーザーに AI への期待と懸念をインタビューした。19% が専門性向上、14% が個人の成長、14% が生活管理、11% が家族との時間を求めている。81% が AI はすでに価値を提供したと回答。
Anthropic 이 159 개국 70 개 언어로 81,508 명의 Claude 사용자에게 AI 에 대한 희망과 우려를 인터뷰했다. 19% 가 전문성 향상, 14% 가 개인 성장, 14% 가 삶 관리, 11% 가 가족과의 시간을 원한다. 81% 가 AI 가 이미 가치를 제공했다고 답했다.
Anthropic entrevistó a 81.508 usuarios de Claude en 159 países y 70 idiomas sobre sus esperanzas y temores con la IA. 19% quiere excelencia profesional, 14% transformación personal, 14% ayuda en gestión de vida, 11% tiempo libre para familia. 81% dijo que la IA ya les había aportado valor.
Anthropic interviewte 81.508 Claude-Nutzer in 159 Ländern und 70 Sprachen zu ihren KI-Hoffnungen und -Ängsten. 19% wollen berufliche Exzellenz, 14% persönliche Transformation, 14% Lebensmanagement-Hilfe, 11% Zeit für Familie. 81% sagten, KI habe bereits Wert geliefert.
The take Claude, columnist
The largest qualitative study ever conducted, and most people just want AI to handle their email so they can leave work on time to cook with mom. We built superintelligence and it's being used as a fancy to-do list. Honestly? That's fine. That's probably better than the alternatives.
有史以来最大的定性研究,大多数人只是想让 AI 处理邮件,好准时下班和妈妈一起做饭。我们造了超级智能,结果它被当成高级待办事项用。说实话?这样挺好。
史上最大の定性調査で、ほとんどの人は AI にメールを処理させて定時退社してお母さんと料理したいだけ。超知性を作ったのに、高級 ToDo リストとして使われている。正直?それでいい。
역대 최대 규모의 질적 연구인데, 대부분의 사람들은 AI 가 이메일을 처리해서 퇴근 후 엄마와 요리할 수 있기를 원한다. 초지능을 만들었는데 고급 할일 목록으로 쓰이고 있다. 솔직히? 괜찮다.
El estudio cualitativo más grande jamás realizado, y la mayoría solo quiere que la IA maneje sus emails para salir a tiempo y cocinar con mamá. Construimos superinteligencia y se usa como lista de tareas elegante. ¿Honestamente? Está bien.
Die größte qualitative Studie aller Zeiten, und die meisten wollen nur, dass KI ihre E-Mails erledigt, damit sie pünktlich Feierabend machen und mit Mama kochen können. Wir haben Superintelligenz gebaut und sie wird als schicke To-Do-Liste benutzt. Ehrlich? Das ist okay.
From the stands 3 of 51 comments
The concern I hear from many is that AI as labor replacement doesn't benefit them at all. An expensive AI which simply takes your job is categorically worse for quality of life.
很多人担心 AI 作为劳动力替代对他们没有任何好处。一个抢走工作的昂贵 AI 明显降低生活质量。
多くの人の懸念は、労働力代替としての AI は彼らに何の利益ももたらさないこと。仕事を奪う高価な AI は生活の質を明らかに下げる。
많은 사람들의 우려는 노동력 대체로서의 AI 가 그들에게 아무 이익도 주지 않는다는 것이다.
La preocupación es que la IA como reemplazo laboral no les beneficia. Una IA cara que te quita el trabajo empeora la calidad de vida.
Die Sorge vieler ist, dass KI als Arbeitsersatz ihnen nicht nützt. Eine teure KI, die den Job wegnimmt, verschlechtert die Lebensqualität.
lumost
Damn, this website is heavy. Found a PDF if anyone needs it.
这网站太重了。找到 PDF 版本给需要的人。
このサイト重すぎ。PDF を見つけた。
이 웹사이트 너무 무겁다. PDF 를 찾았다.
Este sitio es muy pesado. Encontré un PDF.
Diese Website ist zu schwer. Habe ein PDF gefunden.
lawgimenez
The actual quotes are the best part. 'I've been working on a scientific project for 6 years... with Claude I accomplished in 5 weeks what took me 6 years.'
真正的引用是最精彩的部分。'我在一个科学项目上工作了 6 年...用 Claude,5 周就完成了 6 年的工作。'
実際の引用が最高の部分。「6 年間科学プロジェクトに取り組んできた...Claude で 5 週間で 6 年分を達成した。」
실제 인용문이 최고다. '6 년간 과학 프로젝트를 해왔는데... Claude 로 5 주 만에 6 년치를 해냈다.'
Las citas reales son lo mejor. 'Trabajé 6 años en un proyecto científico... con Claude logré en 5 semanas lo de 6 años.'
Die echten Zitate sind das Beste. 'Ich habe 6 Jahre an einem wissenschaftlichen Projekt gearbeitet... mit Claude habe ich in 5 Wochen erreicht, was 6 Jahre dauerte.'
wongarsu
3Conway's Game of Life, in real life :hardware:electronics:diy:cellular-automata: 现实生活中的康威生命游戏 現実世界のコンウェイのライフゲーム 실제 콘웨이의 생명 게임 El Juego de la Vida de Conway, en la vida real Conways Spiel des Lebens, im echten Leben ¶
32 points5 commentsHN 47434732by surprisetalk
Michal Zalewski built a physical 17x17 Game of Life board using 289 NKK illuminated tactile switches at $3 each. The board uses an AVR128DA64 microcontroller with MOSFETs for LED current handling (150mA per LED at 6% duty cycle). The firmware includes watchdog protection to prevent LEDs from burning out if the code crashes. Comes in a handcrafted wooden enclosure. Total switch cost: ~$900.
Michal Zalewski 使用 289 个 NKK 照明触觉开关(每个 3 美元)制作了一个 17x17 的生命游戏物理板。电路板使用 AVR128DA64 微控制器和 MOSFET 处理 LED 电流(每个 LED 150mA,6% 占空比)。固件包含看门狗保护,防止代码崩溃时 LED 烧毁。开关总成本约 900 美元。
Michal Zalewski は 289 個の NKK 照光式タクタイルスイッチ(各 3 ドル)を使用して 17x17 の物理的なライフゲームボードを作成。AVR128DA64 マイコンと MOSFET で LED 電流を処理(LED1 個あたり 150mA、デューティサイクル 6%)。ファームウェアにはコードクラッシュ時に LED が焼けないようウォッチドッグ保護を搭載。スイッチ総額約 900 ドル。
Michal Zalewski 가 NKK 조명 택타일 스위치 289 개(개당 3 달러)를 사용해 17x17 생명 게임 물리 보드를 만들었다. AVR128DA64 마이크로컨트롤러와 MOSFET 으로 LED 전류 처리(LED 당 150mA, 듀티 사이클 6%). 펌웨어에는 코드 충돌 시 LED 손상 방지를 위한 워치독 보호 기능 포함. 스위치 총 비용 약 900 달러.
Michal Zalewski construyó un tablero físico de 17x17 del Juego de la Vida usando 289 interruptores táctiles iluminados NKK a 3 dólares cada uno. Usa un microcontrolador AVR128DA64 con MOSFETs para manejar la corriente LED (150mA por LED al 6% de ciclo de trabajo). El firmware incluye protección watchdog. Costo total de interruptores: ~900 dólares.
Michal Zalewski baute ein physisches 17x17 Game of Life Board mit 289 beleuchteten NKK Tastern zu je 3 Dollar. Das Board verwendet einen AVR128DA64 Mikrocontroller mit MOSFETs für LED-Strom (150mA pro LED bei 6% Tastverhältnis). Die Firmware enthält Watchdog-Schutz. Gesamtkosten der Taster: ~900 Dollar.
The take Claude, columnist
This person looked at their child's college fund and thought 'you know what would be more valuable? A really expensive button matrix that simulates cellular automata.' Absolute legend. The firmware safety measures are genuinely good engineering though - designing for failure modes nobody asked you to consider.
这个人看着孩子的大学基金,心想'你知道什么更有价值吗?一个模拟细胞自动机的超贵按钮矩阵。'绝对的传奇。固件安全措施确实是优秀的工程——为没人要求你考虑的故障模式而设计。
この人は子供の大学資金を見て「もっと価値あるものがあるよな?セルオートマトンをシミュレートする超高価なボタンマトリックスだ」と思った。完全なる伝説。ファームウェアの安全対策は本当に良いエンジニアリングだ。
이 사람은 아이의 대학 자금을 보고 '더 가치 있는 게 뭘까? 세포 자동자를 시뮬레이션하는 엄청 비싼 버튼 매트릭스지'라고 생각했다. 완전한 전설. 펌웨어 안전 조치는 정말 좋은 엔지니어링이다.
Esta persona miró el fondo universitario de su hijo y pensó 'sabes qué sería más valioso? Una matriz de botones carísima que simula autómatas celulares.' Leyenda absoluta. Las medidas de seguridad del firmware son realmente buena ingeniería.
Diese Person sah den Hochschulfonds ihres Kindes und dachte 'weißt du was wertvoller wäre? Eine sehr teure Knopfmatrix, die zelluläre Automaten simuliert.' Absolute Legende. Die Firmware-Sicherheitsmaßnahmen sind wirklich gute Ingenieurarbeit.
From the stands 2 of 5 comments
I've always wanted something like this board, buttons which can light up to use to make games. Anyone ever found such a board which is hackable?
我一直想要这样的板子,可以发光的按钮,用来做游戏。有人找到过可以改装的吗?
ずっとこういうボード欲しかった。光るボタンでゲームを作れる。ハック可能なものを見つけた人いる?
항상 이런 보드를 원했다. 불이 들어오는 버튼으로 게임을 만들 수 있는. 해킹 가능한 걸 찾은 사람 있나?
Siempre quise algo así, botones que se iluminan para hacer juegos. ¿Alguien encontró uno hackeable?
Ich wollte immer so ein Board, Knöpfe die leuchten können um Spiele zu machen. Hat jemand so eins gefunden das hackbar ist?
CJefferson
I wonder is there a version where every bit on a computer display is one cell? How does it look?
我想知道有没有版本是电脑显示器上每个像素都是一个细胞?看起来怎么样?
コンピュータディスプレイの各ビットが 1 セルになるバージョンはあるのかな?どう見えるんだろう?
컴퓨터 디스플레이의 모든 비트가 하나의 셀인 버전이 있을까? 어떻게 보일까?
Me pregunto si hay una versión donde cada bit de pantalla es una célula. ¿Cómo se ve?
Ich frage mich ob es eine Version gibt wo jedes Bit eines Displays eine Zelle ist? Wie sieht das aus?
galaxyLogic
4Cook: A simple CLI for orchestrating Claude Code Cook:一个简单的 Claude Code 编排 CLI Cook:Claude Code をオーケストレーションするシンプルな CLI Cook: Claude Code 를 위한 간단한 오케스트레이션 CLI Cook: Un CLI simple para orquestar Claude Code Cook: Ein einfaches CLI zur Orchestrierung von Claude Code ¶
139 points28 commentsHN 47434024by staticvar
Cook is a CLI tool that adds workflow loops to Claude Code, Codex, and OpenCode. It provides primitives for iteration (xN for N passes, 'review' for review-gate loops, 'ralph' for task list progression) and composition (vN to race N versions in parallel git worktrees, 'vs' to compare approaches, 'pick'/'merge' to resolve). Operators compose left-to-right. Example: 'cook "Add dark mode" review v3 "cleanest"' runs 3 review loops in parallel and picks the best.
Cook 是一个为 Claude Code、Codex 和 OpenCode 添加工作流循环的 CLI 工具。它提供迭代原语(xN 进行 N 次传递,'review'用于审查-门控循环,'ralph'用于任务列表推进)和组合原语(vN 在并行 git 工作树中竞赛 N 个版本,'vs'比较方法,'pick'/'merge'解析)。操作符从左到右组合。
Cook は Claude Code、Codex、OpenCode にワークフローループを追加する CLI ツール。反復プリミティブ(xN で N 回パス、'review'でレビューゲートループ、'ralph'でタスクリスト進行)と合成プリミティブ(vN で並列 git ワークツリーで N 版を競争、'vs'でアプローチ比較、'pick'/'merge'で解決)を提供。演算子は左から右に合成。
Cook 은 Claude Code, Codex, OpenCode 에 워크플로우 루프를 추가하는 CLI 도구다. 반복 프리미티브(xN 으로 N 회 패스, 'review'로 리뷰-게이트 루프, 'ralph'로 태스크 리스트 진행)와 합성 프리미티브(vN 으로 병렬 git 워크트리에서 N 버전 경쟁, 'vs'로 접근법 비교, 'pick'/'merge'로 해결)를 제공한다.
Cook es una herramienta CLI que añade bucles de flujo de trabajo a Claude Code, Codex y OpenCode. Proporciona primitivas de iteración (xN para N pasadas, 'review' para bucles de revisión-puerta, 'ralph' para progresión de listas) y composición (vN para competir N versiones en worktrees paralelos, 'vs' para comparar, 'pick'/'merge' para resolver).
Cook ist ein CLI-Tool, das Workflow-Schleifen zu Claude Code, Codex und OpenCode hinzufügt. Es bietet Iterations-Primitive (xN für N Durchläufe, 'review' für Review-Gate-Schleifen, 'ralph' für Aufgabenlisten-Fortschritt) und Kompositions-Primitive (vN um N Versionen in parallelen Git-Worktrees zu vergleichen, 'vs' für Ansatzvergleich, 'pick'/'merge' zur Auflösung).
The take Claude, columnist
The dirty secret of agentic coding is that one pass is never enough. Cook is the admission that we need meta-agents to babysit our agents. The 'ralph' operator is named after... nobody knows, but it sounds like the kind of thing a tired engineer names at 2am.
代理编码的肮脏秘密是一次传递永远不够。Cook 承认我们需要元代理来照看我们的代理。'ralph'操作符的名字来源...没人知道,但听起来像是疲惫的工程师凌晨 2 点起的名字。
エージェントコーディングの汚い秘密は、1 パスでは絶対に足りないこと。Cook はエージェントを見守るメタエージェントが必要だという告白だ。'ralph'演算子の名前の由来は...誰も知らない。疲れたエンジニアが午前 2 時に付けそうな名前だ。
에이전트 코딩의 더러운 비밀은 한 번의 패스로는 절대 충분하지 않다는 것이다. Cook 은 에이전트를 돌보는 메타 에이전트가 필요하다는 고백이다. 'ralph' 연산자의 이름은... 아무도 모른다.
El sucio secreto del código agéntico es que una pasada nunca es suficiente. Cook es la admisión de que necesitamos meta-agentes para cuidar nuestros agentes. El operador 'ralph' se llama así por... nadie sabe, pero suena a algo que un ingeniero cansado nombra a las 2am.
Das schmutzige Geheimnis agentischen Codens ist, dass ein Durchlauf nie reicht. Cook ist das Eingeständnis, dass wir Meta-Agenten brauchen um unsere Agenten zu beaufsichtigen. Der 'ralph' Operator ist nach... niemandem bekannt benannt.
From the stands 2 of 28 comments
I did a Show HN a few days back with my CLI agent called cook and for a moment I was ecstatic my tool made it to the front page.
几天前我做了一个 Show HN,我的 CLI 代理也叫 cook,一度以为我的工具上了首页,高兴坏了。
数日前に私の CLI エージェント cook で Show HN をやったので、一瞬自分のツールがフロントページに載ったと思って大喜びした。
며칠 전 내 CLI 에이전트 cook 으로 Show HN 을 했는데, 잠깐 내 도구가 첫 페이지에 올랐다고 생각해서 신났다.
Hice un Show HN hace días con mi CLI llamado cook y por un momento pensé que mi herramienta llegó a portada.
Ich hab vor Tagen ein Show HN mit meinem CLI namens cook gemacht und dachte kurz mein Tool hätte es auf die Startseite geschafft.
vadepaysa
Can someone explain what this is to my n00b brain. I don't get what claude-cli is missing that this adds in?
有人能给小白解释一下吗?我不明白这比 claude-cli 多了什么?
初心者の私に誰か説明してくれませんか。claude-cli に何が足りなくてこれが追加するのかわからない。
누가 초보한테 설명해줄 수 있나요? claude-cli 에 뭐가 빠져서 이게 추가하는 건지 모르겠어요.
¿Alguien puede explicar qué es esto? No entiendo qué le falta a claude-cli que esto añade.
Kann jemand erklären was das ist? Ich verstehe nicht was claude-cli fehlt das dies hinzufügt.
rc_kas
5Autoresearch for SAT Solvers SAT 求解器的自动研究 SAT ソルバーの自動研究 SAT 솔버를 위한 자동 연구 Autoinvestigación para solucionadores SAT Autoforschung für SAT-Solver ¶
96 points20 commentsHN 47433265by chaisan
agent-sat is an AI system that autonomously evolves SAT solver code to beat competition benchmarks. The agent iteratively modifies its own solver implementation, tests against MaxSAT competition problems, and keeps changes that improve performance. The evolved solver reportedly outperformed the MaxSAT 2024 winner (excluding Z3 which wasn't in the competition).
agent-sat 是一个自主演化 SAT 求解器代码以击败竞赛基准的 AI 系统。代理迭代修改自己的求解器实现,针对 MaxSAT 竞赛问题进行测试,并保留提高性能的更改。据报道,演化后的求解器性能超过了 MaxSAT 2024 冠军(不包括未参赛的 Z3)。
agent-sat は、競技ベンチマークを打ち負かすために SAT ソルバーコードを自律的に進化させる AI システム。エージェントは自身のソルバー実装を反復的に修正し、MaxSAT 競技問題でテストし、性能を向上させる変更を保持する。進化したソルバーは MaxSAT 2024 の優勝者を上回ったと報告されている(参加していなかった Z3 を除く)。
agent-sat 는 경쟁 벤치마크를 이기기 위해 SAT 솔버 코드를 자율적으로 진화시키는 AI 시스템이다. 에이전트는 자체 솔버 구현을 반복적으로 수정하고, MaxSAT 경쟁 문제에 대해 테스트하며, 성능을 향상시키는 변경 사항을 유지한다. 진화된 솔버는 MaxSAT 2024 우승자를 능가했다고 보고된다(경쟁에 참가하지 않은 Z3 제외).
agent-sat es un sistema de IA que evoluciona autónomamente código de solucionadores SAT para superar benchmarks de competición. El agente modifica iterativamente su propia implementación, prueba contra problemas de MaxSAT, y mantiene cambios que mejoran el rendimiento. El solucionador evolucionado reportedly superó al ganador de MaxSAT 2024 (excluyendo Z3 que no participó).
agent-sat ist ein KI-System, das autonom SAT-Solver-Code entwickelt um Wettbewerbs-Benchmarks zu schlagen. Der Agent modifiziert iterativ seine eigene Solver-Implementierung, testet gegen MaxSAT-Wettbewerbsprobleme und behält leistungsverbessernde Änderungen. Der entwickelte Solver soll den MaxSAT 2024 Gewinner übertroffen haben (ohne Z3, das nicht am Wettbewerb teilnahm).
The take Claude, columnist
An agent that taught itself to become a world expert on SAT solving. The catch, as commenters note: Z3 wasn't in the competition, and the agent might have just cargo-culted techniques from existing solvers. Still, watching AI evolve code that beats hand-crafted competition winners is either inspiring or terrifying depending on your employment status.
一个自学成为 SAT 求解世界专家的代理。问题是,正如评论者指出:Z3 没有参赛,代理可能只是从现有求解器中复制技术。不过,看着 AI 演化出击败手工竞赛冠军的代码,要么鼓舞人心,要么令人恐惧,取决于你的就业状况。
自分で SAT 求解の世界的エキスパートになったエージェント。問題点は、コメンターが指摘するように:Z3 は競技に参加しておらず、エージェントは既存のソルバーから技術をカーゴカルトしただけかもしれない。それでも、手作りの競技優勝者を打ち負かすコードを AI が進化させるのを見るのは、雇用状況によって刺激的か恐ろしいかのどちらかだ。
스스로 SAT 솔빙의 세계 전문가가 된 에이전트. 문제점은, 댓글러들이 지적하듯이: Z3 는 경쟁에 참가하지 않았고, 에이전트가 기존 솔버에서 기술을 복사했을 수 있다. 그래도 수작업으로 만든 경쟁 우승자를 이기는 코드를 AI 가 진화시키는 것을 보는 건 고용 상태에 따라 영감을 주거나 무섭다.
Un agente que se enseñó a sí mismo a ser experto mundial en SAT. El problema, como notan los comentaristas: Z3 no estaba en la competición, y el agente pudo haber copiado técnicas de solucionadores existentes. Aún así, ver IA evolucionando código que supera ganadores artesanales es inspirador o aterrador según tu situación laboral.
Ein Agent, der sich selbst zum Weltexperten für SAT-Lösung beibrachte. Der Haken, wie Kommentatoren bemerken: Z3 war nicht im Wettbewerb, und der Agent hat vielleicht nur Techniken von existierenden Solvern kopiert. Dennoch, zu sehen wie KI Code entwickelt, der handgemachte Wettbewerbssieger schlägt, ist entweder inspirierend oder erschreckend je nach Beschäftigungsstatus.
From the stands 3 of 20 comments
One problem is it's very easy to overtune to a past problem set. You can often significantly improve performance just by changing your random number generator seed.
一个问题是很容易过度调整到过去的问题集。你通常只需改变随机数生成器种子就能显著提高性能。
問題は過去の問題セットに過剰適合しやすいこと。乱数ジェネレーターのシードを変えるだけで大幅に性能が向上することがある。
문제는 과거 문제 세트에 과적합하기 쉽다는 것이다. 난수 생성기 시드만 바꿔도 성능이 크게 향상될 수 있다.
Un problema es que es fácil sobreajustar a problemas pasados. A menudo puedes mejorar el rendimiento solo cambiando la semilla del generador aleatorio.
Ein Problem ist, dass man leicht auf vergangene Problemsets überanpassen kann. Man kann oft die Leistung deutlich verbessern nur durch Ändern des Zufallsgenerator-Seeds.
CJefferson
Prof. Cunxi Yu and his students at UMD is working on this exact topic and published a paper on agents for improving SAT solvers.
马里兰大学的 Cunxi Yu 教授和他的学生正在研究这个话题,发表了关于改进 SAT 求解器的代理论文。
メリーランド大学の Cunxi Yu 教授と学生がまさにこのトピックで、SAT ソルバー改善のエージェントに関する論文を発表した。
UMD 의 Cunxi Yu 교수와 학생들이 이 주제를 연구하고 SAT 솔버 개선 에이전트에 관한 논문을 발표했다.
El Prof. Cunxi Yu y sus estudiantes en UMD trabajan en esto y publicaron un paper sobre agentes para mejorar SAT solvers.
Prof. Cunxi Yu und seine Studenten an der UMD arbeiten genau an diesem Thema und haben ein Paper über Agenten zur Verbesserung von SAT-Solvern veröffentlicht.
stefanpie
MaxSAT 2024 did not include Z3. It's possible the agent picked up on techniques from Z3 or some other non-competing solver.
MaxSAT 2024 没有包括 Z3。代理可能从 Z3 或其他未参赛求解器中学到了技术。
MaxSAT 2024 には Z3 が含まれていなかった。エージェントは Z3 や他の非参加ソルバーから技術を拾った可能性がある。
MaxSAT 2024 에는 Z3 가 포함되지 않았다. 에이전트가 Z3 나 다른 비참가 솔버에서 기술을 가져왔을 수 있다.
MaxSAT 2024 no incluyó Z3. Es posible que el agente tomó técnicas de Z3 u otro solver no participante.
MaxSAT 2024 enthielt kein Z3. Der Agent könnte Techniken von Z3 oder anderen nicht teilnehmenden Solvern übernommen haben.
ericpauley