От усреднённой разности к спектральному модулю
Часть I. Окружность
Эта заметка продолжает две работы, которые удобно прочитать заранее, хотя для понимания основной идеи это не обязательно. Мы будем ссылаться на них просто как на [BDK] и [S]:
[BDK] Sharp Jackson Inequality with a Special Modulus of Continuity — ResearchGate
[S] Note on the best approximation in L¹ metric — ResearchGate
Цель здесь не пересказать эти работы. Скорее хочется показать, что из двух довольно специальных задач неожиданно вырастает более широкая картина. Она начинается внутри классической теории приближения, но почти незаметно приводит к языку дифференциальных уравнений, спектральной теории и вероятности.
При этом исходная идея остаётся очень простой: гладкость можно измерять не одной разностью, а правильно выбранным средним разностей.
1. Знакомая тема: вторая производная и Фавар
Возьмём окружность длины \(2\pi\) и оператор
\[ L=-\frac{d^2}{dx^2}. \]Его собственные функции знакомы каждому:
\[ e^{ikx}, \]а собственные значения равны
\[ k^2. \]Если у функции отсутствуют первые гармоники,
\[ f\perp {\cal T}_{n-1}, \]то классическая теорема Фавара для второй производной даёт точную оценку
\[ \|f\|_\infty \le \frac{\pi^2}{8n^2}\|Lf\|_\infty. \tag{1} \]Здесь число
\[ \frac{\pi^2}{8} \]не случайная техническая константа. Это точная норма обратного оператора \(L^{-1}\) на спектральном хвосте.
Поэтому (1) можно читать не только как теорему теории приближения, но и как простейшую априорную оценку решения дифференциального уравнения
\[ Lu=g \]при условии, что низкие частоты удалены.
Уже здесь два языка стоят рядом:
\[ \text{теория приближения} \qquad\text{и}\qquad \text{оценка обратного дифференциального оператора}. \]Долгое время удобнее было говорить на первом языке. Ниже второй язык постепенно станет естественнее.
2. Первый шаг в сторону: \(W_2\)
В [BDK] вместо обычной отдельной второй разности используется специальная усреднённая разность.
Пусть
\[ \chi_h(t) = \frac1h{\bf 1}_{(-h/2,h/2)}(t) \]— нормированная характеристическая функция интервала, а
\[ S_hf=f*\chi_h \]— обычное среднее Стеклова. Тогда вводится
\[ \boxed{ W_2(f,h)=\|f-S_hf\|_\infty. } \tag{2} \]На первый взгляд это может выглядеть менее естественно, чем привычный модуль непрерывности. Но достаточно один раз раскрыть определение.
Если
\[ \Delta_t^2f(x) = f(x+t)-2f(x)+f(x-t), \]то
\[ f(x)-S_hf(x) = -\frac1h \int_0^{h/2}\Delta_t^2f(x)\,dt. \tag{3} \]Следовательно, \(W_2\) — это просто средняя вторая разность. Не выбирается один шаг \(t\); усредняются все шаги между \(0\) и \(h/2\).
Для гладкой функции из (3) немедленно следует
\[ \boxed{ W_2(f,h) \le \frac{h^2}{24}\|Lf\|_\infty. } \tag{4} \]Так что \(W_2\) действительно является характеристикой второго порядка. В [BDK] именно эта более тонкая характеристика позволила существенно лучше согласовать теорему Джексона с точной теоремой Фавара. Note_on_the_best_approximation_…
Главный результат [BDK] особенно прост. В исходной нормировке периода \(1\), при
\[ h=\frac{\alpha}{2n}, \]получено
\[ E_{n-1}(f) \le \left( \sec\frac1\alpha+ \tan\frac1\alpha \right) W_2(f,h), \tag{5} \]причём при
\[ \alpha=1,3,5,\ldots \]константа неулучшаема. Note_on_the_best_approximation_…
После простого изменения масштаба это та же теорема на окружности длины \(2\pi\).
3. Почему точность здесь важнее самой формулы
Формула (5) интересна не столько красивой комбинацией \(\sec\) и \(\tan\), сколько механизмом её появления.
Введём оператор
\[ D_h=I-S_h. \]Тогда
\[ W_2(f,h)=\|D_hf\|_\infty. \]Если положить
\[ g=D_hf, \]то задача состоит в обращении оператора \(D_h\). Формально и затем строго на подходящем пространстве
\[ \boxed{ D_h^{-1} = I+S_h+S_h^2+\cdots. } \tag{6} \]Поэтому
\[ f = g+S_hg+S_h^2g+\cdots. \]Последовательные степени \(S_h\) означают последовательные свёртки с \(\chi_h\); возникают B-сплайны всё возрастающей гладкости.
И здесь произошло существенное совпадение: на канонических шагах одна и та же сигнатура оказывается подходящей для всей этой последовательности. Поэтому верхние оценки складываются без потери, а построенная из той же последовательности функция даёт точность. Это подробно реализовано в [BDK]. babenko_kryakin_dolmatova(1)
Если отбросить технические детали, остаётся важный принцип:
\[ \boxed{ \text{хороший модуль — это не просто мера гладкости;} } \]\[ \boxed{ \text{он должен быть согласован с оператором, который мы умеем обращать.} } \]Именно этот принцип понадобится дальше.
4. Небольшая неожиданность в [S]
Работа [S] на первый взгляд занимается другой задачей: наилучшим \(L^1\)-приближением некоторых квази-бернуллиевых ядер.
Для двух основных ядер там получены точные величины
\[ E_{n-1}(K_1)_1 = \tan\frac{\pi}{2n}, \]\[ E_{n-1}(K_2)_1 = \sec\frac{\pi}{2n}-1. \tag{7} \]Note_on_the_best_approximation_…
Но если теперь, задним числом, посмотреть не на сами функции, а на их Fourier-коэффициенты, обнаруживается нечто более интересное. За исключением нескольких низких гармоник,
\[ \widehat K_1(k) = \frac{k}{i(k^2-1)}, \]а
\[ \widehat K_2(k) = -\frac1{k^2-1}. \tag{8} \]Note_on_the_best_approximation_…
Знаменатель
\[ k^2-1 \]сейчас трудно не заметить.
У обычного обратного оператора \(L^{-1}\) знаменатель был бы \(k^2\). Здесь он заменён на
\[ k^2-1. \]То есть в формулах [S] уже скрыто присутствует сдвинутый оператор
\[ L-1. \]Это не было необходимо формулировать так для решения исходной задачи. Но именно такое прочтение подсказывает следующий шаг.
Почему вообще ограничиваться оператором \(L\)? Почему не рассматривать
\[ L\pm\lambda? \]Так появляется спектральный параметр.
5. Поворот: \(L+\lambda\)
Для начала удобнее взять
\[ \boxed{ L+\lambda, \qquad \lambda>0. } \]Знак «плюс» здесь полезен: нет резонансных собственных значений, обратный оператор положителен, а значит сохраняется смысл усреднения.
Рассмотрим нормированный резольвент
\[ \boxed{ A_\lambda = \lambda(L+\lambda)^{-1}. } \tag{9} \]Зачем множитель \(\lambda\)?
Потому что тогда
\[ A_\lambda1=1. \]То есть постоянная функция при таком усреднении не меняется.
На гармонике \(e^{ikx}\)
\[ A_\lambda e^{ikx} = \frac{\lambda}{k^2+\lambda}e^{ikx}. \tag{10} \]Низкие частоты почти сохраняются, высокие подавляются.
Это уже выглядит как сглаживающий оператор.
Теперь делаем ровно то же, что делали для среднего Стеклова:
\[ \boxed{ D_\lambda=I-A_\lambda } \]и определяем
\[ \boxed{ W_\lambda(f) = \|D_\lambda f\|_\infty. } \tag{11} \]Это и есть новый, спектральный модуль.
Само название здесь менее существенно, чем конструкция:
\[ \boxed{ \text{тождественный оператор} - \text{естественное усреднение}. } \]Именно так был устроен \(W_2\). Именно так устроен \(W_\lambda\).
6. Первый мост: одна гармоника
Прежде чем говорить о резольвентах и вероятности, полезно проверить новый объект на самой простой функции
\[ f(x)=\cos kx. \]Для старого модуля \(W_2\)
\[ S_hf = \frac{\sin(kh/2)}{kh/2}\,f, \]поэтому
\[ W_2(f,h) = \left| 1- \frac{\sin(kh/2)}{kh/2} \right| \|f\|_\infty. \tag{12} \]Для нового модуля
\[ \boxed{ W_\lambda(f) = \frac{k^2}{k^2+\lambda}\|f\|_\infty. } \tag{13} \]В области малых частот обе величины ведут себя квадратично:
\[ 1-\frac{\sin(kh/2)}{kh/2} \]ведёт себя как
\[ \frac{k^2h^2}{24}, \]а
\[ \frac{k^2}{k^2+\lambda} \]при \(k^2\ll\lambda\) ведёт себя как
\[ \frac{k^2}{\lambda}. \]Поэтому два масштаба естественно сопоставить условием
\[ \boxed{ \frac{h^2}{24} = \frac1\lambda. } \tag{14} \]Или
\[ h\sqrt\lambda=\sqrt{24}. \]Новый модуль не является чем-то совершенно чужим старому. В области малых частот они измеряют одну и ту же вторую гладкость, только делают это различными способами.
7. Но что означает \(A_\lambda\) в обычном пространстве?
До сих пор \(W_\lambda\) введён спектрально. Для специалиста по Fourier-рядам этого, возможно, достаточно. Но есть более наглядная картина.
Резольвента допускает представление
\[ \boxed{ \lambda(L+\lambda)^{-1} = \int_0^\infty \lambda e^{-\lambda t}e^{-tL}\,dt. } \tag{15} \]Оператор
\[ e^{-tL} \]— обычный тепловой оператор: за время \(t\) он размывает функцию согласно уравнению теплопроводности.
А множитель
\[ \lambda e^{-\lambda t}dt \]— вероятностная плотность.
Поэтому (15) можно прочитать буквально:
выбирается случайное время \(T\), после чего функция подвергается тепловому усреднению в течение времени \(T\), а затем результат усредняется по всем возможным \(T\).
Случайное время \(T\) имеет экспоненциальное распределение со средним
\[ \frac1\lambda. \]Здесь полезно сделать маленькое уточнение. Это не распределение Пуассона. Распределение самого времени ожидания — экспоненциальное. Оно тесно связано с пуассоновским процессом: именно так распределено время ожидания первого события.
Таким образом, теория вероятностей появляется здесь не как дополнительная техника, искусственно присоединённая к задаче. Она уже содержится в резольвенте.
8. Случайный шаг вместо фиксированного шага
Есть ещё один способ увидеть ту же конструкцию.
Поскольку ядро \(A_\lambda\) положительно и симметрично, существует вероятностная мера \(\nu_\lambda\) на расстояниях \(0\le r\le\pi\), для которой
\[ D_\lambda f(x) = -\frac12 \int \Delta_r^2f(x)\,d\nu_\lambda(r). \tag{16} \]Сравним это с (3):
\[ D_hf(x) = -\frac12 \int \Delta_r^2f(x)\,d\nu_h(r), \tag{17} \]где \(\nu_h\) — просто равномерная мера на
\[ 0<r<\frac h2. \]Вот, пожалуй, наиболее простой смысл обоих модулей.
Для \(W_2\) мы выбираем случайный шаг равномерно на коротком интервале.
Для \(W_\lambda\) закон шага выбирается самим оператором \(L+\lambda\).
На прямой этот закон особенно прост:
\[ d\nu_\lambda(r) = \sqrt\lambda\,e^{-\sqrt\lambda r}\,dr, \qquad r>0. \tag{18} \]На окружности получается его периодический аналог.
Поэтому собственная длина нового модуля равна
\[ \boxed{ \ell_\lambda=\frac1{\sqrt\lambda}. } \tag{19} \]Шаг не исчез. Он перестаёт быть одним заранее заданным числом и становится распределением масштабов.
Это, пожалуй, первый момент, где язык классической теории приближения действительно начинает расширяться.
9. Что мы выигрываем, разрешив шагу стать случайным?
На первый взгляд компактное среднее \(W_2\) кажется предпочтительным: все разности имеют малый шаг и никакого хвоста нет.
Но у резольвентного модуля есть другое преимущество, и оно неожиданно сильнее.
Из определения
\[ D_\lambda = I-\lambda(L+\lambda)^{-1} \]получаем
\[ D_\lambda = L(L+\lambda)^{-1}. \]Следовательно, на функциях без постоянной составляющей
\[ \boxed{ D_\lambda^{-1} = I+\lambda L^{-1}. } \tag{20} \]Это почти удивительно.
Для \(W_2\) обратный оператор дал бесконечный ряд (6).
Для \(W_\lambda\) обращение закончилось после двух членов.
Именно здесь новый язык начинает окупаться.
10. Фавар возвращается — но уже в новой форме
Пусть снова
\[ f\perp{\cal T}_{n-1}. \]Положим
\[ g=D_\lambda f. \]Тогда из (20)
\[ f = g+\lambda L^{-1}g. \]А классическая теорема Фавара говорит
\[ \|L^{-1}g\|_\infty \le \frac{\pi^2}{8n^2}\|g\|_\infty. \]Поэтому
\[ \boxed{ \|f\|_\infty \le \left( 1+\frac{\pi^2\lambda}{8n^2} \right) W_\lambda(f). } \tag{21} \]На этом месте особенно важно сказать: формула (21) — уже следующий шаг, а не утверждение из [BDK] или [S]. Она появляется, если прочитать обе работы вместе и принять спектральный сдвиг всерьёз.
Но происходит ещё одно совпадение.
Та же Favard-сигнатура, которая даёт точность классической оценки, даёт точность и здесь. Если обозначить её через \(\sigma_n\), то естественный экстремальный объект имеет совсем простой вид
\[ \boxed{ f_{n,\lambda} = \sigma_n+\lambda L^{-1}\sigma_n. } \tag{22} \]Поэтому константа в (21) оказывается точной:
\[ \boxed{ C_n(\lambda) = 1+\frac{\pi^2\lambda}{8n^2}. } \tag{23} \]Задача, которая могла бы выглядеть как новая задача на точную константу для целого семейства операторов, практически исчезла после правильного выбора модуля.
11. Два предельных состояния
Теперь легко понять роль параметра \(\lambda\).
Если
\[ \lambda\to\infty, \]то
\[ \frac1{\sqrt\lambda}\to0. \]Усреднение становится всё более локальным, а
\[ \lambda D_\lambda f \]для гладкой функции стремится к
\[ Lf. \]То есть в этом пределе новый модуль возвращает нас к локальной второй производной и к классической теореме Фавара.
Если же
\[ \lambda\downarrow0, \]то естественная длина
\[ \frac1{\sqrt\lambda} \]растёт. Усреднение охватывает всю окружность, и \(A_\lambda\) постепенно превращается в проектор на постоянные функции. Поэтому
\[ D_\lambda f \longrightarrow f-\bar f. \]Новый модуль становится глобальным.
Это важный момент: \(\lambda\) управляет не только коэффициентом в формуле. Он меняет сам характер измерения гладкости — от локального к глобальному.
12. Почему старый \(W_2\) всё же следует сохранить
После появления \(W_\lambda\) можно спросить: нужен ли вообще \(W_2\)?
Мне кажется, да — и по двум причинам.
Во-первых, \(W_2\) остаётся очень хорошим языком для классической теории приближения. У него видимый геометрический шаг, компактный носитель, непосредственная связь с конечными разностями. Читателю не требуется ни спектральная теория, ни полугруппы, ни вероятность, чтобы понять его смысл.
Во-вторых, именно \(W_2\) показывает, что \(W_\lambda\) не является искусственной спектральной конструкцией. Оба модуля имеют одну форму:
\[ \boxed{ \text{вторая разность} \quad\longrightarrow\quad \text{усреднение по шагу} \quad\longrightarrow\quad \text{норма}. } \]Различается только мера усреднения.
Для \(W_2\) эту меру выбирает геометрия короткого интервала.
Для \(W_\lambda\) её выбирает дифференциальный оператор.
13. Что, собственно, выросло из [BDK] и [S]
Теперь две исходные работы можно увидеть как два разных намёка на одну более широкую конструкцию.
[BDK] показывает, что усреднённая разность может быть гораздо лучше согласована с обращением и с точными константами, чем произвольно выбранная характеристика гладкости. Там правильный оператор разности приводит к ряду Неймана, B-сплайнам и точным оценкам.
[S] показывает с другой стороны, что спектральный сдвиг \(k^2\mapsto k^2-1\) естественно появляется внутри вполне классической задачи \(L^1\)-приближения, а разложение по ядрам Бернулли позволяет сохранить Favard-механизм.
Следующий шаг состоит в том, чтобы перестать рассматривать эти два явления раздельно.
Вместо фиксированной разности и вместо одного специального сдвига вводится семейство
\[ L+\lambda \]и вместе с ним — семейство естественных усреднений
\[ \lambda(L+\lambda)^{-1}. \]Тогда возникает
\[ W_\lambda, \]и вместе с ним задача переходит в более широкий язык:
\[ \boxed{ \text{приближение} \;\longleftrightarrow\; \text{дифференциальный оператор} \;\longleftrightarrow\; \text{спектр} \;\longleftrightarrow\; \text{резольвента} \;\longleftrightarrow\; \text{случайное усреднение}. } \]Но мост назад остаётся.
Им служит \(W_2\).
Вместо заключения
В этой первой части важно, пожалуй, удержать не формулы, а три простые мысли.
Сначала была вторая производная и точная теорема Фавара.
Затем оказалось полезно заменить одну вторую разность её правильно выбранным средним. Так возник \(W_2\), и точность теоремы Джексона оказалась связана с обращением соответствующего оператора.
Наконец, спектральный сдвиг \(L+\lambda\) сам предлагает своё усреднение. Из него естественно возникает \(W_\lambda\). В нём фиксированный шаг заменяется распределением шагов, а ряд Неймана — двухчленной формулой
\[ D_\lambda^{-1}=I+\lambda L^{-1}. \]Именно здесь теория приближения начинает говорить на языке соседних областей, не теряя при этом своего исходного содержания.
Это, мне кажется, достаточное место для остановки: новый объект уже появился, но читателю ещё не пришлось покидать знакомую окружность.
Комментариев нет:
Отправить комментарий